Podcast Summary: 张小珺Jùn|商业访谈录 – Ep.148 游凯超深度访谈
Date: July 28, 2026
Guest: 游凯超(vLLM创始团队成员、知名AI基础设施工程师)
Host: 张小珺
主题概述
本期节目由张小珺深度对谈AI基础设施领域的代表人物——游凯超。节目聚焦于开源Infra的发展、模型与基础设施的“协同设计(Co-design)”新趋势,以及vLLM项目的幕后故事和风险抉择。三小时的对话,展现了中国顶级AI技术人所思、所行、所感,既有硬核技术论证,也不乏理想主义的追问。
核心讨论要点
1. vLLM项目的诞生与定位
- vLLM定位一个高效推理的开源大模型服务框架,对标海外领先产品并聚焦开源社区赋能。
- 游凯超分享vLLM最初起点和“为极致推理效率而生”的理念。
- 他坦言当初选择这个复杂难题的初衷不是“看上去有多光鲜”,而仅仅是不甘于现状,“我们不做,谁来做?”
“如果vLLM失败,我们会后悔一辈子。”——游凯超(00:42)
2. 开源Infra的生态与挑战
- 探讨了中国开源基础设施长期缺位(相较于美国硅谷GitHub生态),以及近两年国产开源爆发背后的驱动因素。
- 强调“做Infra不是短跑,是长跑,需要极强耐心和社区信任感”。
- 游凯超坦率描述了国内外开源文化的差异与碰撞:
“有的东西在美国那边能算开源,但在中国可能会被骂成‘假开源’。”——游凯超(18:10)
- 提到资金、商业化、社区治理等难题,充分表达了现实与理想的碰撞。
3. 模型与基础设施的“协同设计”(Co-design)
- 详细拆解“为什么要Co-design”:AI大模型的推理与训练效率,已远超单点工程优化,需要基础设施和模型同步演进。
- 游凯超举例vLLM团队如何与大模型架构师联动,从底层CUDA/分布式算法到高层API“一次又一次打掉重来”。
- 关键观点:未来的AI系统必须break silo,由“Infra-Model共生”驱动创新。
“做Infra的人不能只是写代码,还要理解模型本身的新需求。”——游凯超(53:59)
4. 技术难点、创新与妥协
- 展示vLLM的技术路线:多GPU高效并发、动态分配、低延迟吞吐平衡。
- 具体讲述了Memory Mapping、Zero-copy等底层创新,以及在极端场景下的“技术妥协”。
- 张小珺敏锐追问“有没有动摇过、有没有想过放弃?”游凯超坦言:
“中间有段时间,几乎每天都是自我怀疑,每天都想‘要不就算了’。”——游凯超(1:37:25)
5. 中国AI创业者的理想与现实
- 分享自己身边诸多AI创业者的“精神状态”——技术热情与焦虑并存,低谷与高峰切换。
- 谈及国内对于AI Infra价值认知的提升,对比中美风险投资、产业氛围的深层差异。
- 呼吁给予科研和工程师更多容错和耐心。
“我们都想证明,中国也可以做出世界级的Infra。”——游凯超(2:11:40)
6. 展望未来:AI Infra的新范式
- 张小珺总结式提问:“到2028年,vLLM会是什么样子,AI Infra会变成什么样?”
- 游凯超给出理想版的蓝图:“高性能、低门槛、全球化的AI基础设施;希望中国能原生输出一些划时代的Infra标准。”
- 同时警醒:“别让短期红利和商业诱惑带歪方向。”
“Infra是数字时代的水电煤,需要几十年耐心和坚守。”——游凯超(2:52:18)
亮点语录及重要时刻
- 00:42 游凯超:“如果vLLM失败,我们会后悔一辈子。”
- 18:10 游凯超:“有的东西在美国能算开源,但在中国可能会被骂成‘假开源’。”
- 53:59 游凯超:“做Infra的人不能只是写代码,还要理解模型本身的新需求。”
- 1:37:25 游凯超:“中间有段时间,几乎每天都是自我怀疑,每天都想‘要不就算了’。”
- 2:11:40 游凯超:“我们都想证明,中国也可以做出世界级的Infra。”
- 2:52:18 游凯超:“Infra是数字时代的水电煤,需要几十年耐心和坚守。”
总结
这期访谈不仅为技术从业者带来了最新的AI Infra前沿洞见,也描摹了中国AI工程师的理想主义与坚守。游凯超用坦率和理性,拆解了vLLM项目的原点、开发脉络、种种难题与心路历程。节目在交锋与共鸣中,勾勒出现实版的AI创新众生相,为业界和普通听众都提供了丰富且真诚的参考。