中国政策档案 Governance Archive HOLDINGS 235,760 · FONDS 122
Record · 十字路口Crossing ACC. 900069891

Discussion on Vidu S1 Real-Time Interactive Video Model and Inference Acceleration

快一点!再快一点!快到世界能实时生成|和生数科技张金涛聊:Vidu S1、推理加速、实时交互视频

Issuer
十字路口Crossing
Date
Instrument
other
Cited by
0
This document is a podcast transcript featuring an interview with Zhang Jintao of Shengshu Technology, discussing the company's real-time interactive video model Vidu S1 and the underlying inference acceleration technologies including SageAttention, TurboDiffusion, and TurboServe.
Full text · 原文 2,944 字
2·123Your browser does not support the audio element.🚥 没人喜欢等待。<br> 模型越强,推理加速就越重要。<br> 这一期,我们聊「推理加速」。<br> 本周「十字路口」的嘉宾是生数科技的张金涛。月初,他带队发布了 Vidu S1——一个实时交互视频模型:上传一张照片,无论是人物、动漫角色,还是一只宠物,都能变成一个可以和你实时视频通话的 AI 角色。<br> Vidu S1 很快,快到生成速度超过播放速度,并且支持无限时长。这是怎么做到的?<br> 金涛在播客中分享了自己这几年一条清晰的技术主线:从 SageAttention(GitHub 3.5K 星标)、TurboDiffusion(GitHub 3.6K 星标),到 TurboServe——一整套系统级方案,为 S1 实时交互提供底层支撑。<br> 此外,金涛也分享了他对整个 AI「推理加速」领域的观察和判断。<br> 其实这期有意思的,不只是技术。<br> 金涛今年 26 岁,还是清华在读博士。真正把他带进「推理加速」的,是一个很朴素的判断——当大家都默认 FlashAttention 已经把 Attention 算子做到极致时,他却发现:显卡上明明还有更快的计算单元没被用起来 ——「这么明显的收益,为什么没人做?」<br> 所以这期节目,你也可以把它当成一份「年轻研究者样本」来听:在变化极快的 AI 领域,怎么找到自己的方向、怎么判断什么才是「最正确的事」,又怎么把它一路做到最前沿。<br> 🎬 我们的视频播客将同步上线于 @Koji杨远骋 的视频号、抖音、小红书、哔哩哔哩、Youtube 等平台。<br> 📒 文字版将发布于 @十字路口Crossing 公众号。<br> 🟢 01:40 快问快答:年龄、毕业院校、MBTI 与星座、Vidu S1,以及在生数科技负责的工作<br> 🟢 02:48 硬件上明明有更快的计算单元<br> “为什么没有人做?这是很明显的一个收益。”<br> 当大家认为 FlashAttention 已接近极致,张金涛发现 GPU 上仍有更快的计算单元没有用于 Attention。<br> 语言模型早期的 Attention 更受显存传输限制,视频生成模型却严重受计算速度限制。<br> SageAttention 要同时解决底层 GPU Kernel 编程和低比特计算的精度损失,最终成为即插即用的加速方案。<br> 🟢 06:15 从 SageAttention 到 Vidu S1:三层加速<br> 算子层:让 Attention、线性层等计算尽可能逼近硬件上限。<br> 模型层:通过步数蒸馏和稀疏 Attention,把 Diffusion 去噪从约 50 步降到 4 步。<br> 部署层:解决多卡并行、通信与计算重叠、用户请求调度。<br> SageAttention 后来成为事实上的行业标准;TurboDiffusion 推进模型加速,TurboServe 负责流式视频的集群部署。<br> 🟢 11:24 Vidu S1 不只是快<br> “生成速度需要大于播放速度,它才能做到实时生成。”<br> 普通视频模型等待很久生成一段成片,流式模型则要根据用户输入逐帧生成。<br> Vidu S1 实现 540P、25–42 FPS,并能在消费级显卡上运行。<br> 比速度更难的是无限时长:生成一两个小时后,画面仍不能漂移或崩坏,还要持续正确回应用户。<br> 实时交互是第一目标,当前阶段可以适度牺牲画质,但不能牺牲速度。<br> 🟢 15:21 “未来我们的视觉娱乐信号,会被 AI 生成的内容充斥掉。”<br> 电影和短视频是预先生成的离线内容,聊天、恋爱、游戏和日常生活则充满实时视觉互动。<br> 离线视频可以共享播放,实时视频需要为每个人生成不同内容。<br> 张金涛判断,实时交互视觉娱乐的需求会比离线内容更大,而且这条路径已经势不可挡。<br> 🟢 17:30 一只狗和一个游戏搭子<br> 用户已经开始上传宠物图片与它聊天,也有人让二次元角色实时观看游戏画面、陪自己玩游戏。<br> Vidu S1 能理解输入的视频流;把电脑屏幕传给它,它也可以成为看懂 Coding、微信和 Notion 的“程序员鼓励师”。<br> 🟢 20:05 推理加速不只是算子<br> 算子加速之外,还要用稀疏 Attention、MoE 和蒸馏减少模型本身的计算量。<br> 流式 Diffusion 会引入 KV Cache,还要处理用户随时进入、退出,以及多机多卡的集群调度。<br> TurboServe 对应的正是 Serving 层:把计算图、通信与请求调度组合成真正可部署的系统。<br> 🟢 24:39 推理加速的未来,属于更底层和更上层<br> “推理加速的未来,还是属于更底层和更上层。”<br> 中间的算子层会随着编程工具进步逐渐收敛;更底层是面向通用或特定模型设计芯片,更上层是用算法直接减少计算。<br> 像 Taalas 这样针对特定模型做硬件设计,本质是在通用性与极致效率之间取舍。<br> 真正有壁垒的加速需要软硬件 Co-Design:只懂算法,很难判断方案在真实硬件上是否有效。<br> 🟢 28:28 中国视频模型的领先原因<br> Transformer 之后,模型结构逐渐收敛,差距更多来自数据量、数据质量、偏好对齐和数据是否容易学习。<br> 低质量数据不只是没用,还会污染模型;高质量解释能让模型更快学会关键概念。<br> 中国的短视频、直播与电商生态既产生真实需求,也沉淀了更丰富的视频数据;张金涛认为中国视频模型公司目前领先美国。<br> 🟢 33:10 世界领先,是把每个环节都做对<br> “知道世界上最正确、最领先的方法是什么,然后把它正确实现出来。”<br> 朱军让他理解,GPT-3 的成功不是靠某个神秘技巧,而是把每个环节都推到极致。<br> 两行有问题的代码就足以让实验失败;负责人必须能判断方案是否正确、实现是否到位。<br> 带团队还要看见每个人真正想要的是工资、Credit 还是成就感,再从第一性原理协调不同部门。<br> 🟢 37:54 一行代码,速度快一倍<br> “视频生成得跟之前像素级一模一样,但端到端推理速度快了一倍多。”<br> 在清华安静的楼里,他一个线程一个线程地排查底层问题,终于让 SageAttention 跑通。<br> 把 Vidu 里的 FlashAttention 换成 SageAttention 只需改一行代码,输出保持像素级一致,端到端速度却提升一倍多。<br> 他立刻把结果发给陈建飞和朱军;后来又带队负责 Vidu 推理与 S1,把这段经历形容得“像在创业”。<br> 这段最快乐的科研时光,也来自朱军给出的方向、资源和自由氛围。<br> 欢迎订阅「十字路口」:🚦 我们关注新一代 AI 技术浪潮带来的行业新变化和创业新机会。<br> 🚦 十字路口是乔布斯对苹果公司的一个比喻,形容它站在科技与人文的十字路口,伟大的产品往往诞生在这里。AI 正在给各行各业带来改变,我们寻找、访谈和凝聚新一代 AI 创业者和 AI 时代的积极行动者,和他们一起,探索和拥抱新变化,新的可能性。<br> 👦🏻 主播 Koji:我创办了十字路口,发起了 AI Hacker House 这个新一代 AI 创业者的社群空间,在真格基金担任 Venture Partner 投资合伙人。我相信科技尤其是 AI 是我们这一代人最大的价值创造机遇。Koji 的即刻,Koji 的网站<br> 在小宇宙查看该单集文稿