Episode Details

Back to Episodes

#692.Neil Movva:把 AI 推理成本降 10 倍,智能充裕时代如何绕开芯片与电力瓶颈

Published 2 days, 8 hours ago
Description

📝 本期播客简介

本期我们克隆了:Invest Like the Best with Patrick O'Shaughnessy Neil Movva - Making AI 10x Cheaper - [Invest Like the Best, EP.488]

原内容更新时间:Tue, 25 Aug 2026

本期嘉宾是 Sail Research 创始人 Neil Movva,主持人是 Patrick O'Shaughnessy。Sail 正在构建一个面向长周期 AI Agent 的「token 工厂」:通过 API 提供低成本推理,并托管可以在云端运行数小时、数天甚至数周的 Agent。与优先追求实时响应速度的传统推理服务不同,Sail 更关心如何把每个 token 的成本压到最低,让机器能够持续工作,而不是等待人类一次次发出指令。

这场对话从一个核心判断展开:只要把某样东西便宜十倍,它就可能成为全新的产品品类。Neil 认为,未来的 AI 不应只是遇到难题时才调用的「昂贵顾问」,而应成为在后台持续运行、主动完成任务的基础设施。深度研究、网络安全、互联网索引、科学发现和软件验证,都可能因为廉价且长时间运行的 Agent 而被重新定义。

节目还深入拆解了实现这一愿景所需的完整技术栈:软件如何榨干 GPU 性能,吞吐量与低延迟为何存在根本权衡,Cerebras、Groq、AMD 和新型加速器各自适合什么场景,以及为什么分散的小型数据中心、闲置芯片和间歇性能源,反而可能成为推理时代的优势。Neil 也分享了他对英伟达、开源模型、蒸馏、KV cache、Transformer 扩展定律和 AI 基础设施投资周期的逆向判断。

👨‍⚕️ 本期嘉宾

Neil Movva,Sail Research 创始人,长期专注于 GPU、算子、芯片架构、数据中心与能源系统之间的协同优化。他大学时期曾在英伟达工作,亲历 Tensor Core 从早期实验性设计逐渐成为 GPU 核心能力的过程;此后持续从软件栈、底层硬件和系统部署的角度研究如何提升计算效率。

Neil 的独特之处在于,他并不把推理基础设施局限于某一种芯片或某一座超大规模数据中心,而是采取「拾荒者策略」:购买市场上被低估、被忽视或不符合传统数据中心要求的芯片与电力,再通过自研软件、异构调度和分散式集群把它们组织起来。对于想理解 AI Agent 经济学、芯片供应链、算力投资逻辑和推理成本下降路径的听众,这是一场非常难得的全栈式对谈。

⏱️ 时间戳

00:00 开场:什么是 token 工厂

01:00 Neil Movva 与 Sail Research 的业务介绍

02:14 Sail 如何通过 API 提供低价 token

02:34 Sailboxes:运行数小时、数天甚至数周的 Agent

02:59 「充裕」为何是公司的核心主题

从实时聊天到后台 Agent

03:23 为什么 token 成本是当前的北极星指标

04:39 开源模型与「智能主权」的兴起

05:24 Agent 的未来为何属于长周期任务

06:04 「最好的延迟就是完全没有延迟」

长时间运行的 Agent 会带来什么

06:58 测试时计算扩展与更长任务时长

08:12 后台工作负载可能从 50% 走向 90%

08:23 深度研究、互联网索引与网络安全

10:52 主动型个人助理与「便宜的智能」

软件、GPU 与吞吐量的重新优化

13:31 Sail 为什么必须从软件做起

14:08 Tensor Core 与矩阵乘法

18:40 GPU 的本质:吞吐量机器

19:13 延迟优化与吞吐量优化的根本权衡

芯片架构:从 NVLink 到 Cerebras

21:19 NVLink 如何降低低延迟推理的成本

22:55 为什么 Sail 没那么在乎低延迟推理

24:12 Cerebras、Groq 与片上 SRAM

28:49 KV cache:动态知识为何成为瓶颈

Transformer、数据与可验证智能

32:08 Transformer 的核心:注意力与序列建模

34:10 为什么 Transformer 像一块极佳的海绵

35:57 互联网是对数据的一次性补贴

37:00 强化学习环境如何成为下一阶段的数据来源

拾荒者策略:芯片、电力与小型数据中心

44:13 芯片稀缺与算力分配

45:17 「没有坏的芯片,只有不合理的价格」

50:52 训练基础设施如何转向推理基础设施

52:29 为什么 1 兆瓦的小型数据中心更适合 Agent 推理

分散式算力与能源创新

53:12 组合不同芯片、性能与数据中心

54:15 用 1000 个小型数据中心对抗 1 吉瓦中心

55:12 为什么后台 Agent 可以接受 95% 的可用性

56:41 太阳能、风能与可预测的间歇性电力

投资判断、开源未来与智能充裕

1:01:20 AI 全栈中最需要提升效率的环节

1:01:59 KV cache 压缩与算力调度

1:07:30 前沿实验室领先三到六个月的溢价

1:10:02 便宜 token 与每个人自己的 Agent harness

公司的未来与 Neil 的逆向观点

1:13:36 短期看好英伟达,但永远不要看空英伟达

1:16:10 芯片初创公司必须理解的四个供应链瓶颈

1:17:31 英伟达为何不直接下场卖 token

1:18:20 导师、性能工程与理解完整技术栈

🌟 精彩内容

💡 让某样东西便宜十倍,它就会成为新产品

Neil 并不把降低 token 成本视为单纯的基础设施优化,而是把它看成创造新需求的前提。当智能变得足够便宜,Agent 就不必只在用户明确提出请求后才工作,而可以主动探索、反复尝试,并持续完成过去因成本过高而无法执行的任务。

「我们认为,只要你把某样东西便宜十倍,它就会成为一个全新的产品品类。」

💡 最好的延迟,是完全没有延迟

传统 AI 产品把延迟理解为用户等待答案的时间,因此追求每秒吐出更多 token。Neil 则提出另一种产品形态:让 Agent 在后台运行,人类不必实时参与。当用户早上醒来时,工作已经在夜里完成

Listen Now

Love PodBriefly?

If you like Podbriefly.com, please consider donating to support the ongoing development.

Support Us