148. 对游凯超3小时访谈:开源Infra、和模型Co-design 、“如果vLLM失败,我们会后悔一辈子”
127 min
•Jul 28, 2026about 1 month agoSummary
In this 3-hour interview, vLLM co-founder and Infraact CTO You Kaichao discusses his journey from algorithm research to building critical AI infrastructure, the evolution of vLLM from academic project to production system, and how model architecture and inference systems must co-design for optimal efficiency in the AI era.
Insights
- Academic publishing has become saturated and unreliable as a validation mechanism; systems engineering with measurable real-world impact is now a more reliable path to meaningful contribution
- Successful open-source infrastructure projects require a supporting company to handle legal agreements, resource allocation, and long-term maintenance that volunteer communities cannot provide
- Model architecture and inference infrastructure must be co-designed like hardware and software; neither can optimize independently without sacrificing overall system efficiency
- The transition from open-source community to company requires founders to overcome significant psychological barriers and competing financial offers, driven by belief in the project's historical importance
- Inference optimization is becoming as critical as model training; token generation efficiency determines whether advanced models can be deployed economically at scale
Trends
Shift from algorithm-centric AI research to systems-centric infrastructure as the bottleneck for AI advancementOpen-source AI infrastructure projects increasingly require commercial company backing to achieve production-grade reliability and scaleModel-infrastructure co-design emerging as essential practice; models must be designed with specific hardware and inference system constraints in mindChina's open-source model ecosystem explosion (2025) creating urgent demand for inference optimization and localized infrastructure supportSpeculative decoding and token prediction becoming standard inference optimization techniques as single-token generation becomes the latency bottleneckCoding agents and AI-assisted development creating new challenges for open-source community management, requiring stricter contribution validationMixture-of-Experts (MoE) architecture adoption driving need for specialized inference system support and hardware-algorithm co-optimizationPyTorch Foundation model for long-term open-source sustainability gaining adoption; separates technical governance from legal/trademark protectionInference engine becoming as strategically important as model weights; companies competing on inference efficiency rather than just model qualityHardware specialization (post-Moore's Law) forcing algorithm designers to understand and optimize for specific GPU/accelerator architectures
Topics
vLLM architecture and PagedAttention algorithmModel and infrastructure co-design principlesOpen-source project governance and community managementInference optimization techniques (speculative decoding, continuous batching)Mixture-of-Experts (MoE) model architectureHardware-software co-optimization for AIAcademic research vs. systems engineering career pathsStartup formation and fundraising for infrastructure companiesChina's open-source model ecosystem developmentToken prediction and speculative decoding (D-Flash, D-Spark)PyTorch Foundation and open-source sustainabilityLarge language model inference at scaleAttention mechanism optimization (RoPE, Flash Attention)GPU utilization and inference efficiency metricsCommercial vs. open-source infrastructure strategy
Companies
vLLM
Open-source inference engine for large language models; core project discussed throughout, now under PyTorch Foundation
Infraact
Company founded by You Kaichao and team to commercialize vLLM and provide production inference infrastructure
DeepSeek
Chinese AI company using vLLM; exemplifies model-infrastructure co-design with advanced optimization techniques
Meta
Uses vLLM for inference; major stakeholder in PyTorch ecosystem and open-source AI infrastructure
OpenAI
Referenced for ChatGPT's impact on AI landscape; context for why inference infrastructure became critical
UC Berkeley
Institution where vLLM originated through Ion Stoica's Skylab; source of open-source infrastructure tradition
PyTorch Foundation
Now hosts vLLM as flagship project; provides legal structure and long-term sustainability for open-source infrastructure
Tsinghua University
You Kaichao's alma mater; represents academic research foundation before transition to systems engineering
NVIDIA
GPU manufacturer; collaborates with vLLM on inference optimization and hardware-software co-design
AMD
Semiconductor company participating in vLLM governance and inference optimization efforts
Red Hat
Software company contributing to vLLM maintenance and governance as part of open-source ecosystem
Character AI
Company where Simon (vLLM co-founder) worked; explored supporting vLLM through corporate partnership
xAI
Elon Musk's AI company that recruited You Kaichao for infrastructure work; represents competing opportunity
Thinking Machines Labs
AI startup that recruited You Kaichao; represents alternative career path from vLLM commercialization
Databricks
Ion Stoica's previous company; exemplifies successful open-source infrastructure commercialization model
Kimi
Chinese AI company using vLLM for inference; part of China's open-source model ecosystem
Mistral
European AI company; early adopter of vLLM for model inference
Google DeepMind
Where You Kaichao did internship work; represents alternative research career path
People
You Kaichao
Main guest; vLLM creator discussing journey from algorithm research to building AI infrastructure company
Ion Stoica
Mentor who encouraged You Kaichao to commercialize vLLM; represents open-source infrastructure tradition
Li Zhuohan
vLLM paper author; early full-time contributor; now at OpenAI but maintains high-level technical involvement
Simon
vLLM co-founder with prior startup experience; manages community and company operations
Wu Suuk
PagedAttention algorithm inventor; CTO; most difficult to recruit due to competing offers from xAI and others
Michael Jordan
Machine learning theory mentor; influenced You Kaichao's research philosophy and career direction
He Kaiming
Computer vision pioneer; exemplifies successful large-scale experimental validation in algorithm research
Weng Jiayi
Classmate who transitioned to AI infrastructure; similar career path to You Kaichao
David Patterson
Computer architecture pioneer; influenced vLLM team's understanding of open-source project lifecycle
Geoffrey Hinton
Referenced for Capsule Networks example of hardware-algorithm mismatch in AI research
Quotes
"如果vLLM失败,我们会后悔一辈子"
You Kaichao•~2:30:00
"只要你是一个好的软件,总会有人用的"
Ion Stoica•~0:45:00
"模型和infra的co-design就像发电机和电力系统的关系,不同的地方有不同的资源,需要不同的设计来最大化效率"
You Kaichao•~3:00:00
"学术圈现在是一个礼乐崩坏的状态,投稿就像抽彩票一样"
You Kaichao•~0:30:00
"我们四个人可能是同样的一个共享一个大脑,然后只是需要谁的时候谁出嘛"
You Kaichao•~2:45:00
Full Transcript
Hello, everyone. 坚持着他们所相信的开源精神 那今年初呢Infra也获得了1.5亿美元的种子人融资 所以我们也讨论了当一个寄托着社区情怀的开源项目 变成一个商业化的组织运营之后 他所面临的抉择转变与思考 那另外一方面呢我们也非常希望在AI Infra的技术前沿上 给大家带来一些新的思路 所以我也和尤凯超聊了聊 AI Infra 模型结构 甚至连Honis Engineering都要联合设计的 实在背景之下 那这个多方的联合设计 应该怎么做 那接下来就是我对尤凯超的访谈 期待2026年 我们和AI共同进步 最后我们是怎么说动 它的呢就是 就是小之以情动之以理 就是最后跟它说 你如果不跟我们一起创业 你赚到了很多钱但是十年之后WinM项目失败了你是开心还是不开心那么比如说有的地方水流比较湍急有的地方水流比较平缓那你在这两个地方怎么样去设计你的发动机使得你的发动机能够更好的利用这部分能量这个就是所谓的模型和infra的co-design那我觉得DeepSig的深厚的infra工底可能是来自于他们之前做换方量化的时候对性能的一些极致的 这个压榨 因为大家把token和电做一个类比的时候 可能会觉得就是电它是比较通用的 电它是可以调制的 但是token它是没有办法去做调制的 就是你没有办法说把一个dipseek模型的token 转化为一个kimi的token 这个token它是带着模型的烙印的 Hello 凯超 先给观众朋友们打个招呼 大家好 我是游凯超 我是本科和博士 都是毕业于清华大学 然后现在是Infraact的联合创始人兼首席科学家 那我现在的主要任务呢 就是在维护以VM为核心的这个开源大模型推理引擎的这个相关生态 然后我们的目标是为AGI提供软件服务 我也是小俊播客的这个忠实粉丝啊 我们之前看到很多行业的这个前辈朋友们都来小俊这里参加过这个播客 那像张强宇老师啊 这个杨志玲学长啊以及Manus的记忆超我们都很熟然后我也很荣幸有这次机会来这里跟大家一起分享一下我的一些经历和看法说到Manus的记忆超PIC其实凯超这次来我们节目也是他帮忙介绍的对对那个是去年12月份的时候的事了然后那个时候其实Manus还没有被Meta收购然后但那段时间其实我也在忙着成立公司所以虽然答应了要来但没想到一拖就是半年然后现在这个也终于来兑现我的承诺了我们在正式聊技术之前还是非常好奇的想要探究一下你个人的经历你是从什么时候开始接触计算机编程的你是从初高中就有一些竞赛相关的经历吗我大概是从2015年开始接触这个编程的因为我在这个初高中期间我的主要任务就是这个中考高考就是正常的这个高中的学习然后副业会做一些这个数学物理竞赛方面的学习然后提高一些知识水平算是一个我觉得比较典型的理科生然后竞赛方面其实成绩也不算亮眼物理竞赛有一个省级一等奖用处不是很大最后对高考也没有很多用处所以竞赛结束之后我就继续准备高考所以我并没有算法编程比赛的经验但是有一个我对计算机编程的了解就是我们在学数学物理的时候然后当时接触一些辅助计算的软件比如说我印象深刻的有一个叫做几何画板的东西你可以用它去观察各种函数图像然后去做一些物理的仿真的动画的演示虽然现在可能没什么人知道这些软件了就是技术发展的太快了虽然我回想起来好像只是十年前但是好像已经是上一个世纪的东西了没有人记得了但是当时这些软件还是给我带来很大的震撼就是让我看到计算机能做很多事情然后还有一个比较相关的事情是清华大学在2013年的时候推出了学堂在线这个基本就是对标国外的EDX的这个在线教育平台那么1415年的时候呢就是我在学习竞赛的时候那么学堂在线呢把很多清华的老师请来录制了一些教学视频然后我当时一开始是在上面学习这个大学物理因为我们中学的这个物理竞赛本质上就是大学物理加一些微积分然后呢学完了这个大球物理和微积分之后刚好这个学堂在线他当时推出了跟EDX联名的一个python的课程然后我就跟他学了这个python那么这个算是我第一次认真的学习一门编程语言虽然就是初中高中阶段我的主要任务是中考高考但是我不太喜欢这种无意义的重复劳动就是我不喜欢这个刷题所以我这个更喜欢学习新知识那所以我的很多备考的时间都是拿来学习这种各种课程虽然说这个题目比较简单的时候他不会考到这些知识但是我个人还是觉得学习这些课程能够学到一些新的知识然后他对于我深刻的理解一些难题也是有帮助的那这部分内容你是没有办法通过重复刷题来获得的所以我个人感觉就是学到知识这个比较满足虽然高考确实他最后就是我那一年高考他比较简单所以我的这些能力可能也并没有体现在高考分数上面没有用武之地对所以最后其实高考分数也就是勉强插着清华的分数线上来的但是我觉得这个学习的过程还是很快乐的就是确实是学到了这些知识我觉得是有用的你刚进清华的时候好像还不属于就是最优秀成绩最好的那一波好像是高考分数线比清华的录取线是高了两分然后你是怎么在清华逆袭的我觉得不太好说逆袭吧确实高考分数线就是可能分数就是比分数线高那么两三分但是我觉得这不是很能反映就是你不能拿他去预测一个人在大学的这个过程我觉得他更多取决于你在大学里面干什么就是那个分数他只是一个admission就是你进了清华之后应该把这个分数就忘掉了你就应该接下来做大学要做的事情你当时有多卷我看到一些记录说比如说你一入学就开始疯狂追赶大一发了100多封邮件给老师请教问题然后又看了一万多页的学习资料而且你的经读笔记你的论文经读笔记在校使馆展出等等等等吧最后36门课程获得了4.0的成绩这个是比较老的历史了已经过了好多年了但是我觉得这个也不是一个卷吧更多是说就我觉得我还是比较享受学习然后呢在大学里面确实我觉得学到了很多知识那比如说你说发100多封邮件给老师请教那其实十多门课然后每一门课你每周给老师发个邮件请教那就有100多封了所以它我觉得更多是一个坚持的过程吧包括学习各种东西做的笔记也是因为我觉得在大学里面学到了很多然后再记录了很多就是我并没有把笔记的数量这个字数什么的当做一个目标来优化它就是对所以我觉得更多是一个自然而然的就是学习的结果 因为很多人认识你是从VLLM开始的 但是你在清华读书的时候你的研究方向应该做的是迁移学习 但这和你后来做的推理系统看起来完全是两个世界 就是你是怎么从一个算法研究者过渡到今天这个深度参与系统工程的人呢 我觉得这里面就有几个主要原因吧 我可以这个稍微说一下 第一个原因是我觉得这个学术圈现在是一个礼乐崩坏的状态就是我在刚接触人工智能研究的时候大概是18年吧然后那个时候可能一届学术会议他一年大概几百篇论文左右然后这个时候我觉得他的学术社区比较健康就是你投稿之后然后呢审稿人可以给你一些比较有建设性的这个积极的反馈他会告诉你说你这个地方做的好那个地方做的不好然后你应该这样去改进就是我们真正的是在认真的讨论怎么样把一个工作做的更好但是呢后来这个学术会议的规模的扩张它的速度远远超过了社区成长的速度这个人工智能会议的投稿数它每一年都是在成这个几何级数的增长所以一个显而易见的问题就是审稿人的数量和质量都远远比不上这个投稿的数量那所以在这个时候其实审稿的质量急剧下降那你的投稿就像这个抽彩票一样就是你中或者不中可能跟你这个工作的质量本身已经没有很大的关系了那我是亲眼见证了这个过程所以只能说比较痛心吧然后但是这个大厦将亲他不是我一个人能够改变的所以我就离开人工智能算法的研究然后就不再把这个论文发表作为我的追求了这是什么时候发生的变化这是你大家记得的时候这个应该主要还是研究生期间的就是我18年开始嘛然后像1920年有这个趋势但是我觉得到后面这个20年之后这个趋势变得越来越严重然后这也是一个逐渐的过程对吧就我不是哪一天开始突然就不投了更多是感受到这个趋势然后就逐渐的就对这个投论文不再有那么大的兴趣了然后第二个原因是这个我发现人工智能算法领域的成果其实它很多时候依赖于这个机器学习系统怎么说呢就是我们做研究的时候这个我们认为人工智能领域的这个算法领域的天花板至少就是我个人心中的天花板就是何凯明老师就是他的这个一战封神然后呢后面每一次就是只要凯明老师的这个主页有变动或者他又开了他又挂了一个新的这个archive的论文我们这些同学就像收到了新的神域一样就是上天降下了一个神域原来又有一个新东西可以做了对吧然后我们就可以就去拜读这个凯明老师的论文那那个时候其实我们这个私下讨论的时候也经常会有这样的疑问就是看完了凯明老师的论文我们觉得这个 想法实在是太自然了 就是浑然天成的感觉 一开始就应该这样设计 但是好像类似的想法 其实我也早就想过 可能在实验室的组会上 我们几个月前探讨这个问题的时候 我们也说你这个东西这样设计 是不是就可以了 我们甚至可能还做过一点小的实验 去验证说这个东西有没有效果 那为什么最后成功的是凯明老师呢 除了他个人非常厉害的原因之外 我分析出来的一个结论就是凯明老师做的事情它不仅是方法简洁有效而且它是做了大规模的实验的那我们实验室里面的这些小虾米是吧我们只是在玩我们这个玩具数据集然后呢在上面就有点这个螺丝壳里做道场的感觉一个小小的数据集我们玩出花来了然后但是并没有做规模化的实验那当我尝试着把这个手头上的实验规模扩大的时候这个显而易见的事实就是 支撑实验的机器学习系统以及对应的数据,它其实才是决定成败的关键,而不是说你去调cross entropy的五种加权方法,所以这让我更关注机器学习领域的一个进展。 然后第三个原因是一些工业界朋友提供的反馈。 That's what I like to participate in the event And share some friends And talk to people Now what's happening now in the工業界 And what's happening I'm a little bit more In the 2022 year There's a World War II It's a world of a Geek-like and the view of the world And the view of the view And on the top of the poster I was there a poster And on the meeting I met with the meeting And I met with the And I just hold on the face And I'm talking to you And I聊了 a few hours He also这个有耐心跟我聊一个多小时啊然后张老师他当时在矿市啊他应该就是矿市的手机科学家然后呢他聊的时候啊我就很惊讶的发现他作为这个目标检测算法领域的一个啊这个大佬吧他跟我们聊的其实不是说啊目标检测算法我们现在又发明了什么新的Loss这个效果怎么样了他其实说的更多是说啊他们现在面对的就当时啊他们当时面的这个面对的复杂硬件对于软件带来的挑战以及像矿式它也要设计一些为目标检测CV算法所特化的一些硬件那么这些硬件上为了特殊负载设计的这些硬件它有多级的缓存结构然后你需要手动控制在芯片的多级缓存之间的数据流动所以矿式的工程师他们每天最头疼的不是说我这个参数怎么调而是说我英伟达的QDNN代码里面又有这样的问题那样的问题然后我需要适应这个硬件去写这样的算子那样的算子所以这个是对我触动比较大的一个事情然后我觉得或许还有其他种种原因但是这三个原因已经能回答很多问题了他们共同促进我就是促使我这个从算法的研究转向机器学习系统的这个工程的研究你刚才讲的时候我在想有没有可能凯明的那个年代就更适合算法的研究然后可能发展到今天可能算法的研究我不知道能不能叫做某种程度上雕花然后今天可能更适合大规模的系统研究你觉得跟时代背景有关系吗绝对我觉得是有关系的我觉得确实凯明老师的时代属于是算法研究的蓝海然后那个时候还没有那么多人进来所以我觉得算法那边能做的事情比较多但是后面算法做的事情可能就是一些比较low-hanging的fruit都被大家摘完了然后再往前面可能很难有一些根本性的变化以及还有就是大家对于scaling law的这个信仰就是你的基本算法其实不需要怎么变你只需要不断的在网上面堆算力堆数据你的效果就能够自然的变得更好虽然你对算法失去了希望然后对发论文失去了希望但是其实你在本科的阶段其实也发了很多很好的论文然后你也进行了很长时间算法的研究你要不要讲讲就是你整个的研究的一个过程从本科到博士然后你的研究轨迹是怎么发生变化的对刚才说的那个转变其实是在博士期间就是我本科也没有做很久的研究当时也是在跟随了这个算法的研究那我的研究方向呢其实我觉得很多时候还是靠缘分和这个时代的趋势吧 Just when I was in high school, I was in high school in the online course. And then there was a course. And then, I was able to go through the EDX and other other programs. And then I learned that knowledge of the knowledge. That was a bit of a popular course. Like the WUENDA老師's computer science. And then there was a professor of the computer science. And then there was a Christopher Manning老師's computer science. These are very famous.而且非常好的公开课那么我学完了这些课程之后就尝试找个实验室做一些研究然后当时刚好我们学院里面也有一个老师在做这方面的研究所以我就从人工智能深度学习这方向开始研究然后后面也是在老师手下他就是我的博士生导师然后我就在这继续读完了博士你为什么没有当时考虑出国有考虑出国其实一开始是准备出国留学的但是后面受疫情的影响比较大就刚好撞上疫情了然后也不想那么折腾就留在学校里吧对然后本科期间做的事情呢主要是跟导师做一些这个我们叫做数据稀缺场景下的高校学习就是提升机器学习算法的泛化性但后来发现呢就是这部分研究它比较锦上添花就是别人已经做好了一个任务然后呢他可能做的不是那么好然后呢我再把一个通用的方法用上去然后希望给它提升1%到2%的准确率这个就很依赖于别人就没有办法大规模的应用所以后面实验室在这方面的投入其实也逐渐的变少了然后19年暑假的时候我是去加州大学伯克利分校的我们这个Michael Jordan老师手下做过一段时间的暑期研修然后学习了一下美国那边的一些前沿的AI进展也是开阔了眼界然后当时其实已经有一些苗头就是在做大模型相关的技术了回来之后就是博士入学之后呢那么也是这个研究方向逐渐在往大模型这方面靠吧那么我是2020年开始读博士的然后那个时候大模型其实已经在开始发展了就2020年应该就是这个GPC3发布的时候然后但是我们实验室的这个算力资源也非常有限所以我们没有办法做这个大规模的易训练的一些实验那我就根据我们能支配的算力 And then we research some of the models of the way to the way This is a long time There is a lot of success But actually There is a similar problem It is a bit more than a thing We do a year of time We research all of the way Maybe in the beginning of the time It will increase 1% to 2% of the effect But you will find One year after There is a better better More of the more The more of the new training model That you just need to Just to change the new training model You bring the money比 my算法还大 So 加上刚才讲到的一些原因 我博士的后半段就从人工智能的算法研究 切换到了人工智能机器学习系统方面的研究 然后我是在2024年的时候又申请去加州大学伯克利分校交流 然后接触了VYM 然后再开始做大模型推理系统 在你博士开始之前的2019年 应该是对你来说有两件比较重要的事情 一个是你去Michael Jordan老师那里去做交流然后你遇到了现在的合伙人这个是一个非常重要的事情然后第二个是你获得了清华特奖这两个事情的先后顺序是什么样的应该先是暑期研修就是这个交流这个是在2019年的暑假然后特奖是在2019年的年底左右所以在那个交流你第一次遇到你现在的合伙人也是VLM的发起人的时候你对他的是什么印象当时是一个什么样的故事你在知乎上分享过这段经历对 我可以把具体展开一下2019年暑假刚才说到我在Michael Jordan老师那里做鼠研然后Michael Jordan老师他是隶属于一个叫做Rice Lab的实验室这个实验室他是UC Berkeley的EECS系下面的一个实验室然后这个实验室他是专注于机器学习系统的设计那么他其实就包括两部分一部分是机器学习一部分是系统然后Michael Jordan老师他当时是负责机器学习算法的方向然后我在研修期间也经常参加实验室的各种活动所以也借此机会接触了更多机器学习系统方面的知识刚才说到的我们VLM的创始人之一也是我们的好朋友李卓翰那么他是实验室当时是2019年秋季即将入学的博士新生就是他比我高一级所以当时我是大三然后他已经大四结束了他已经申请完了他在Young Stoica老师那做博士然后呢当时他是在实验室参加一些入学前的交流活动那我对他当时分享的研究经历比较感兴趣然后就跟他加微信沟通了一下所以就是他刚才说的他的导师是Young Stoica他就是负责这个Rise Lab里面的机器学习系统的方向那所以我觉得也是很有幸就是那次暑期研修我有机会同时接触到这个顶级的机器学习算法的老师和系统的老师然后我在暑期研修结束之后呢我是就回清华继续学习嘛然后这个又是比较巧的事情就是这两个老师他刚好那一年是成为我们学院的访问教授所以在我这个结束交换之后就是我结束鼠研之后回到学校他们也紧接着来我们学校访问了就是他们从美国来到中国访问清华然后呢因为我当时在暑期研修的时候跟他们交流过嘛所以我就负责这个他们访问过程中的一些活动的筹备那那个时候其实我心中已经有一些萌芽的想法就是我觉得这个啊机器学习系统非常有意思然后呢我也想做一个比较有影响力的软件但是有一个担心就是总是担心自己啊就是无名小卒然后做出来的东西就是没有人用所以我在一次这个交流活动中呢我跟Yang Stoica老师说就是这个怎么办就是我如果我想做一个机器学习系统但是呢可能又没有人用那我做这个系统的时间是不是浪费了那Young Stoica老师他就用他这个人生阅历告诉我说就是他之前做了很多很多事情然后呢他说只要你是一个好的软件总会有人用的这个也是我对于这个转向机器学系统的一个比较大的影响因素吧就是Young Stoica老师的这个鼓励这其实是个前奏你还没有真正做出选择的时候对对这些是一些线索他们埋下了一些种子然后我后面在学术研究期间也零星的做过一些开源软件的建设比如说2020年的时候那个时候也是疫情反正也没有什么事做只能困在宿舍里面当时和本科同学一起做了一个开源强化学习的系统叫做天兽当时还是训练游戏机器人玩一些Ataria这些视频游戏然后2022年的时候我也做过一些像把我设计的一些机器学习算法贡献给一些主要的开源社区像OpenMM Lab的一些计算机视觉的库以及像PyTorch这些机器学习库所以在开源社区里面也算有一些影响力然后2022年底ChatGPT发布了然后我就是看到当时我们还在一起玩泥挖的朋友青苹果同学对对清苹果聪明在植物上这么称呼他对就是翁嘉义他现在已经是chat gpt的训练师了然后呢当时openAI的每一个博客都是就是圈圈有他名所以就是他已经属于是标柄史册了那那个时候我就在想就是我未来要走向什么方向吗那我当时也跟大家请教了一下然后发现就是大模型相关的研究呢几个方面吧然后一个是这个数据和算法这些是跟公司绑定比较强的就是你的这个算法研究和数据研究都需要公司的比较强的支持公司的这个大量的资源然后呢其中有一部分是机器学习系统那么这一部分你是可以在实验室里面进行小规模的研究然后可以很容易的扩展到大规模的场景的所以这个也是坚定我这个对于研究方向的一个转变然后就是到了23年的时候这个疫情已经基本结束了然后国际交流就恢复了那这个时候呢我们的这个学院的访问教授就再次来我们学院访问然后呢但是那个时候就是UC Berkeley的当时叫Rice Lab然后四年过去之后已经叫这个Sky Lab了然后呢就二三年秋天的时候Young Stoica老师再次这个来我们访问的来我们这里访问的时候我那个时候已经比较坚定了就是我想继续做机器学习系统然后呢我就跟他说我能不能去你那里这个交流访问那这个时候我是 I was with him to say, four years ago, I asked you this question, and then this four years ago I was looking at looking at what I can do. And if I do something interesting, if there are some interesting things, if there are people who will use it? That's true, the result is good. So he also saw this four years ago, and then four years ago he said he still was in the four years ago, and he gave a建议. So he was very impressed, and then he agreed my request. So I was in 2024 when Skylab was in the development of the development of the world. So there is a lot of the sequence of events. But I think if I didn't have the 2019 year-old, I don't have the same time as I joined the channel. I may meet Young Soyka and I will be late. but I think the whole world of the whole world will not happen to change. The whole world is a lot of things that I think is a lot of things. I think I would still be from the whole world of this, from the theory of the entire world, this is a huge part of the whole world. I have been drinking for several years of this. There is a feeling of the feeling of the it is, and I think this is the趋势 of the future. The趋势 of the future is a point that you saw 在算法上和在系统上都非常顶尖的学者 Michael Jordan 和 Ion Stoica老师 你觉得他们的底层思维有什么不一样 底层思维 我觉得 Michael Jordan 老师更偏向学术和理论一些 他做的是机器学习理论 当然他从来不把自己叫做AI研究者 他更多的是研究这个机器学习算法背后的一些这个理论的insight 他也做很多像博弈论啊这个经济学分析啊之类的事情所以他可能更偏理论一些然后啊Yang Stoica老师更偏系统一些然后啊他的追求很简单就是real world的impact所以他做了很多这个开源软件然后很多啊开源软件后面都孵化成了重要的项目然后成为了这个工业界的基础你追求的是后一个对我追求的是后一个而且我觉得啊这是他们两个肯定没有优劣之分啊但是我觉得在当下的那个时代后一个是更值得追求的前一个比较难追求就像我跟温嘉一聊到的就是前一个那种东西你要能做出impact的只能在世界上很少的地方有这样的坑位能够做出这样的影响他跟你的选择也比较相似对吧对他也是做的AI infra就是我们当时一起做那个签售项目就也算是一个比较小的机器学习系统然后其实他当时也是做了一些这个算法方面的尝试然后其实也有很多挫折就是你可能提出一个算法然后投稿论文然后对方说你这个不novel没有用然后他最后可能就觉得那我不如写一个系统就是我告诉你说这些东西就是训出来你就是牛所以你跟乌嘉义是有点心心相惜的味道是吗在读书的时候可能不算是心心相惜吧更多就是我觉得我们还比较志同道合就是大家都觉得这个事情比较有意思然后就一起做你刚才说了你慢慢的对论文丧失了兴趣然后也不想做纯理论的东西但是你在本科的阶段其实还是要去发论文你也是特奖的获得者就这个是怎么发生的呢刚才我们说的是另外一条线就是你是怎么走上系统工程这条路的另外一条线你是怎么在本科阶段就是获得了很多的顶会的认可然后同时拿了情话特奖的 这是一个渐变的过程嘛 对吧 其实学术界他也不是一开始就里约崩坏的 就本科你还是有希望的是吗 对对 充满了希望热情 对就是我而且我刚开始做研究的那个1819年我觉得还是有一些人在踏实做研究的然后做研究就是做算法研究也还是能够被人看见有人认可的然后大概我觉得20年之后可能这方面的兴趣就不是很大当然就是特奖评选它是19年年底所以它凭借的是19年之前的成果然后我刚好也有一些成果所以就去参加了一下在你获得清华特奖的时候你当时还是很兴奋的因为我当时看到你还写过就是要在清华不要做一个观众 要成为舞台中间的一个人 对 我觉得肯定是有兴奋的因素 就是获奖肯定还是比较开心的 然后获奖之后也是朋友圈变得更大了 然后我可以接触到更多的优秀的同辈 那这个是我能感觉到的一个明显的好处 但是我觉得整体上来说 就是这个特奖这个事情 它其实是在被淡化的 就是大家不再赋予它过多的含义 因为新华其实有很多奖学金然后特等奖决金其实只是其中之一然后有些系其实有很大额的奖决金就是比特奖其实奖金多很多很多所以特奖只是奖决金之一然后呢我觉得特奖它是一个特殊历史时期发展的一个产物吧就是当时社交媒体发展的比较快然后呢这个学校当时大力宣扬特等奖决金的评选然后出现了这个像马东韩和马东新这个双胞胎的双料特奖 And then, like this, this is the theory of theory, and the theory of theory, and the research of this kind of topic. And then, I feel a little bit of a bit of a bit of a question. It's just every year of the評選. You can see in this society there are some small changes in the world. And then, everyone will say, this is a year of a thousand people. But, in terms of the fact, there are many different獎金獲得者, he's in the election of the year, he's also a little bit of a young man. He's a big fan of the young man. He's a big fan of the young man. 然后呢其实也就是一个本科生入学这个三年左右那么把这样一个这个同学把它过度的曝光在这个媒体的聚光灯下其实很容易对这个获奖者的这个正常的学习科研生活都产生不必要的干扰嗯所以我觉得我还是比较幸运的就是在我参选的那一年学校已经这个意识到了这一点所以他当时这个取消了特等奖学金的现场答辩的直播 And then after Actually, there is a lot of this This is a little bit of the broadcast So, in the past, you can see Actually, this is the The question of the talk In the discussion of the talk Actually, the talk Is越来越低 And then, it's now It's a little bit of The清华大学 of The普通讲究金 The society of Actually, the discussion The people have never that many Of course That's right Yeah, I think that's That's right But, you know, But you just Do you get a lot of The question of the The question of I got a lot of But I think The discussion of the talk Actually大家总会说今年的特奖评选是评选这一届清华大学的学生里面最厉害的十个本科生我觉得这个说法它本身就不是很恰当因为学校里面我觉得每个同学有自己追求的方向你其实很难拿一个统一的标准说这个就是最厉害的十个人然后他比其他人都厉害我觉得每个人都有自己的方向所以不应该拿一个统一的标准去衡量大家你今天还这么想吗清华是一个舞台但你们不要只做观众我当然可以继续这样想因为我现在已经不在那个舞台上了我已经退下来了对吧然后如果我要对新入学的同学说几句话的话我觉得这几句话还是适用的就是来清华更多的是追求自己的成长对吧 而不是说我在新华里面又看到了什么什么样的人 其实我看你的研究方向就是你早期做千音学习预知试印 然后你就已经开始做像lockme这样的工具 你后来又和翁天忆一起做过天寿 他也是一个类似于标准化的工具箱 你是不是很早期就开始已经想做这种通用工具性的事情 我在想你是不是从更早期开始就已经就是对你现在做的事情更有热情 LockMe那个工作应该已经是2021年的时候了所以那个时候其实我已经在思考着如何转方向的这个问题了然后呢也是另一个趋势就是刚才说到这个算法研究就是这个投稿比较混乱嘛然后你很难有比较确定的让它重稿那么当时我其实发现了另一个事情就是我们做算法研究很多时候需要跟别人争论说我这个东西多么创新就是我的 novelty有多高但是呢还有另一个方向就是你跟别人说我这个东西加速了多少倍这个东西是比较客观的然后当时我们做的算法宣称是跟其他的算法相比有几十倍的性能提升然后这个事情是你可以被验证的然后你也可以分析出来说这个背后的加速的原理是什么所以这个东西让我觉得就是积极学习系统它是一个更确定的领域就是我可以明确的知道我做的贡献是什么而且可以很明确的量化你可以说我的东西不novel但是你不可以说我的东西没有用你对算法那边的彻底的上市希望有没有一个时刻呢有一个事件吗我觉得很难我能理解还是一个过程但是它有最后一根稻草吗对就是它是一个过程然后像刚才我说的我发现机器学系统这个领域我投入更多的时间我做更多的优化就能有更多的收获那这个时候我就逐渐的不再把精力投入到这个算法研究上面了就没有一个关键的事件你有一个导火索吗催化剂吗我觉得没有就是我们之前的认知一直都是这样的就是算法做顶级的算法研究它是有用的但是你要找到这样的发挥这样的职能的这个position是比较困难的可能世界上其实也就只有那几个有限的位置那么在不在那几个位置上没有对应的资源即使做出来这样的算法也是很难发挥作用的就像比如说我没有凯明老师的资源我只是想到了他那些论文的idea也没有用那比如说如果做算法的话可能论文引用数会是一个指标它是一个就是你能够衡量的标准那如果你走向系统研究系统工程这条路的话你的衡量标准是什么你会更看中什么数字吗那这个衡量标准就是你做的东西有多少人用然后呢对大家是否带来了这个真实真正的收益比如说你的这个GitHub的一个项目有多少人这个star了然后有多少人发来感谢信就是在issue里面说我用你的这个东西然后给我提高了多少多少的效率你就不会再用论文去要求自己了对吧对这个时候论文只是一个副产物就是有些算法有些系统工程的实现我们做得很好了然后也已经有很多人在用了那么这个时候我们再把它写成一个论文把里面的一些有价值的东西给它列出来然后这个时候审稿人其实一般都不会说什么其实它可能也就是我们算法的我们这个系统的用户所以这个投稿的过程都比较顺利其实换了一条路来走有过纠结没有没有纠结就是我觉得这个过程还是比较快乐的因为它的正反馈是不断累积的就是你做一个事情你说我这个东西给你加速了两倍然后我明白这个背后为什么加速了两倍这个原理我是确定的所以我也可以很自信的说别人用这个东西就是能加速两倍这个过程中别人给我的反馈是持续不断的累积的相比来说比如说一个算法研究者他提出了一个新的算法然后他说他这个算法在他的场景下提升了2%到3%的准确率可能别人尝试复现的时候又会因为复现的场景不一样甚至可能说你这个算法是不是反而降低的准确率这个过程中其实我觉得很难积累一个正反馈刚才我们讲到19年你认识了Io Stoico教授他的实验室里的学生这可能是一个早期的前奏但是后来他们其实VLM诞生已经是2023年的事情这中间几年你做了什么事情然后跟他们后来的缘分是怎么继续下去的这中间其实就是在做一些探索就前面说到的一些方向的转变都是在这个过程中逐渐积累起来的 And then there are some kind of factors in the future. And then there are some things you can't get out of the country. So you can take some of your research. They're there. I mean, I think that's a bit of a heat-up朝天 in the world. So this is when you're in the end of the future, then chat GPT came out, it was a little bit of a doubt. Right. We're doing what to do with what to do, and what to do with what to do. And then people already did something.一个这么 amazing的东西我们要不现在话题切到VLM上最早他们诞生的时候你是不是还没有加入你是24年才加入对不对对VLM项目的诞生应该是他们23年年中左右中间的中大概6月份左右开源的然后这个工作肯定是更早的在做大概我觉得22年年底他们应该就开始在做这个事情了22年底应该是对然后他们做这个事情然后写了一篇论文然后这个论文投稿然后最后重稿了之后他们放出了这么一个原型的系统当时的创始团队都是IOSOIC教授的学生对吧包括李卓翰对主要是就是作为实验室的一个科研项目来开展的为什么好像Stoico老师的实验室好像萌发过很多这种科研项目这是有什么样的传统吗对他们实验室就是我觉得跟有一些历史一脉相传吧包括我做VM我觉得也是受到这个博克利重工业软件的一个传统的影响就是博克利它有很悠久的这个开源软件的历史包括我们做这个操作系统里面的BSD然后呢芯片领域的这个Risk5然后还有存储领域的RAID然后呢再到这个后面大数据分布式机器学习系统领域的这个Spark啊RAID啊其实都来自于博克利所以说博克利历史上它已经产生了很多很多的著名的开源软件而且这些软件其实都是学生在读期间发起的就是它是从学生的这个一些research的一些project开始的然后呢最后变成学生主要为故然后再把这个社区发展壮大然后再变成这个工业界的一些基础设施说到这个我觉得就是我们可以说一下这个计算机体系结构领域的这个大牛叫David Patterson然后呢他在14年的时候写过一个叫做How to build a bad research center的一个观点论文吧他就是说他过往的几十年的经验就是每一个实验室或者大型研究中心只做五年就够了因为这五年就刚好是博士生毕业的一个周期然后你在这五年里面充分利用一些优秀博士生的时间让他们在五年里静下心来专注一个领域可以极大的促进这个领域的发展所以像当时从AMP Lab做Spark然后再到Rice LabRice Lab应该做出来一个Ray然后再到后面这个Skylab所以其实博克利的这些实验室他们的发展都是一脉相承的所以你可以看到他们实验室的五年的周期和工业界的一些需求的周期一旦他们共振的时候就会诞生一些重要的项目比如说Spark我当时觉得VOM就是下一个项目所以我去博克利之前VOM它已经开源了而且发展相当的迅速所以我觉得历史机遇摆在面前然后我觉得我应该值得投入精力去维护它所以我就尽己所能的去帮助它舒服一个学生去加入这样一个看源项目一直做一个核心的维护者是一个困难的事情吗对这显然是一个非常困难的事情我以为会很简单对因为每个学生他有不同的周期就是他处在他的博士期间的不同的阶段对吧比如说刚入学的博士生那么他可能急着需要发表一些论文来支撑他的毕业然后呢所以他需要去引导一些新的project就是他很难参与到别人的project里面他可以通过参与别的别人的project去练手去学习如何做research但是呢现在的博士生就是都很强就是你可以说他们在博士毕业之前的成果可能都已经够博士毕业了那么他们接下来要做的事情只是把他们的这个研究能力 在博士前一两年的时候 再做出一些新的成果 然后方便他们能够毕业 所以就是低年级的博士生同学 他们都希望有一些新的方向做 他们不希望沿着原来的老路 去巩固一些现有的知识 然后呢 就是博士太后期的同学 他主要急着找工作 因为他马上就要毕业了 要去工业界 对 所以说他不太会花时间 在这个开源项目的维护上面所以最适合的就是做开源项目的同学应该就是博士的中后期然后呢没有什么毕业论文的压力然后呢又对开源项目比较有兴趣这样的同学比较合适你当时正好处于这个阶段对我当时正好处在这样一个时期因为我之前的一些算法研究也基本上够毕业了然后呢我个人也觉得就是我想转变一下研究方向然后呢转变研究方向的话我并不希望在机器学习系统领域有一些论文的发表我更多的希望是拿到一些hands on experience去学习系统是如何build一个系统的所以我对纯工程的问题是完全OK的你让我几个月都在做工程的实现我都是OK的以及我当时觉得VM项目是一个比较重要的历史机遇所以我都是比较全身心的投入在里面 你当时算是第几号成员 第几号的话 我觉得我算是第四个比较主要的吧 前面就是一开始比较主要的同学是这个 就是论文的两个作者嘛 卓汉和乌苏邝 对对 卓汉和乌苏是论文的主要作者 然后呢他们也是这个开源项目的一开始的主要维护的同学 然后接下来主要参与的同学是Simon 就是他现在是我们公司的CEO对然后呢他其实也是一个嗯开源老兵吧就是他跟我差不多大啊应该还比我可能年纪还要再大一些但是他当时本来准备博士入学的时候他 quit了然后呢去参与这个any skill的创业了然后创业了几年之后再回来读博士所以他已经有比较深厚的这个开源社区的相关的经验然后呢他也不是那么看重论文啊更多的是看重这个对现实世界的impact他也觉得这个为我们项目比较重要所以他应该是第三个全职投入的同学然后第四个应该就是我了我过去的时候我也是一个类似的想法反正我有时间我也愿意投入然后这个项目也缺人然后其他的同学这个项目这个论文本身它的作者有很多人但最后其他同学都是因为刚才说到的各种原因他们都去找别的事情做了我觉得有的人可能就会想说如果是一个开源项目的话我需要是发起人就是他需要是我创立的你有这种想法吗我觉得不需要吧就是更多看你能在里面做什么贡献其实当时这个开源项目它整体处于一个非常缺人的状态所以我觉得只要投入热情对 用真心用真心对 用真心就可以所以你是为什么对他如此真心呢是怎么开始的你们就是你们我们19年你刚刚认识卓汉然后你又去交流了嘛然后这个时候跟卓汉还有Usyuk是聊的比较多吗就是你们是就是为什么你觉得这个项目这么新年首先就是这个项目发展的很快然后呢这个项目也确实当时缺人然后我当时有一个判断就是这个就是当时因为ChatGPT已经很火了嘛然后我当时的一个判断就是大家其实当时都在探究怎么训练模型但是很显然就是你把模型训出来之后你是要去做推理那么VOM就是处在这样一个地位就是做大模型的推理的所以我觉得它未来非常的有前途然后这个推理也是一个非常重要的事情所以值得投入这个是2024年对就是我做VOM是2024年的事情了但是我关注到VM是2023年的事情对2023年这个年底就是我当时向Yang Stoica老师申请交换的时候我其实当时已经在里面跟他说了就是我去做的话因为我需要我需要propose一些这个idea嘛就是我去做什么那当时我我这个提出的就有这个大模型推理这一块然后这个时候VM已经有了它已经存在了对它已经存在了所以我说我可以在VM里面做一些事情我们来讲讲这个VLM的核心原理吧假设就是我们对这个系统了解不多能不能跟我们讲讲为什么在那个时候VLM应运而生了然后当时处于一个什么样的市场环境之下对 我觉得这里面可能需要区分两个概念就是VLM和它对应的论文Paget of Tension那篇论文就是VLM的起源是那篇论文嘛然后那篇论文的核心是一个这个Paget of Tension算法那么它是借鉴了操作系统的这个虚拟内存管理的机制来管理这个自回归生成过程中的大模型推理的过程中这个产生的中间状态也叫KVCache那其实时至今日就是VOM它早就不是Page the Tension算法了它是一整个大模型推理的系统它是这个大模型高效运行的一个底座所以VOM它解决的问题其实是这个在模型和硬件都飞速发展然后互相偶合的时候你如何去提供一个高效的推理服务而Page the Tension本身呢它的原理就是说如何去管理自回归生成过程中的这个中间状态也就是KVCache在当时就是放在当时的那个环境下Page the Tension是有一个很大的创新吗我觉得不能算一个很大的创新就是任何一个就是认真的分析大模型推理过程的这个机器学习的研究者都能够想到这个想法所以从学术创新的角度来说Page the Tension算法的创新性甚至是偏低的所以他当时投稿这个是投稿到SOSP的2023这个会议上也是一个非常顶级的系统会议但其实审稿人就已经提出了很多批评说你这东西too simple就是你这个想法太直接了然后没有什么 novelty他最后能发表完全是因为他们做得很早而且做了非常丰富的实验所以最后才是一个以低分的过线的状态被会议接受了然后VM他是Pager the Tension这篇论文被接收之后作者团队开源出来的推理引擎所以这也是为什么你说我们认知VLM的时候不能够只认识到它是Page Detention它应该是它后续做了一系列的事情对VLM是一个推理引擎它代表着一个推理的生态系统Page Detention以及Continuous Batching这两个技术是大模型推理过程中的核心的技术当然也涉及到很多其他后来的推理优化的技术他们都是在VLM这个项目里面的所以当Page Attention这篇论文被接收之后李卓翰他们紧急着做了什么样的事情呢这个里面谁是起到比较关键的作用论文接收之后因为系统的论文他们都有很多要求artifact evaluation就是说你的系统需要被别人复现过然后你的这些数字都需要被别人复现出来说你确实有这些收益所以他们本来就有一个原型系统然后他们后来就是把这个原型系统开源了 uh I think this is with Young Stoyca and the idea of this because Young Stoyca is a book of a book and then he also saw the first book of the book in the book of the book so he just took this book of the book and the team and then he and then he and then he and then and then it is not all the people all the and then all the and then and and and and and the and So, the last thing is, Wusser and Jokhan are two people in the same way. And then there are Simon, there are you. Right. It's a good way to go through your process. It's a good way. Yes, because I'm going to go through. You're going to go through. Yes. Simon? Simon is going to go through. Because I think a company is a good way to go through. It's like it's a good way to go through. Because a company is very different. But a company is a good way to go through.就有的人加入有的人离开你们就会有一些特别的就是情感吗事后来看你觉得这种有开源精神有开源热情的这些人是不是有一些共同的特征就是什么让你们走到一起又是什么让一些人离开对我觉得就是每个人追求的目标不一样吧就是比如说有的人他追求金钱就是你今年哪赚到多少钱对吧然后有的人追求权利你在公司里面爬的多高是一个多高的领导的地位我觉得我追求的就是意义就是我做的事情是不是有意义然后我当时觉得为我们有很重要的历史意义值得我的投入然后这部分决策也是受到Michael Jordan老师和Young Stoica老师的比较大的影响然后其他同学我觉得也是类似加入的同学很多都是因为这个原因加入的当然离开的时候可能有些人也有一些自己的原因这个也不能强求那我觉得整体上来说就是有一句话叫做苍领时而知礼节衣食足而知荣辱那我觉得也是因为我们这个时代这个物质追求这方面已经给我们已经有一个基本的生活保障了那么让我们能够有更多的时间和精力去追求一些非物质的这个精神需求而且呢就是做计算机方向的技术同学其实他的基本的生活需求非常简单对吧就是有吃有住然后有电脑能上网就可以了所以就是我觉得这样艰难的环境为我们筛选出了一批志同道合的人吧他们热爱开源然后热爱技术然后呢跟我们一起这个同甘共苦就是做VM项目做了好几年所以后来他们也就很自然的变成了我们公司的这个初始创业的团队就是我觉得比较感慨就是这个中学课本里面宋东阳马成旭里面这个叫做以中有足乐者不知口体之凤不弱人也我觉得我们这些同学就是非常适合这一句话因为我们心中做着就是做着我们认为我们快乐的事情所以我们就不觉得吃的喝的穿的享受不如他们当然现在我们有了资源我们也会让我们的同学在实现精神追求的同时有更充足的物质资源这样子让自己的生活没有后顾之忧24年25年在你加入之后 有没有发生一些让你印象很深刻的事情 这也是在你的公司成立之前的VLM的两年 对 24年我觉得主旋律其实就是一个重构 因为23年的论文发布 然后再是23年的一个prototype出来 然后这个prototype需要从实验的原型走向一个生产级的可用 在这个过程中我们调研了很多像业内其他的推理引擎的设计然后最终在年底的时候推出了从V0到V1的一个重构的计划然后25年的主旋律就是一个大规模部署就是硬件和模型都变得越来越大然后开源模型的发展的重心从欧美转移到了中国然后这里面比较巧的一个事情也是25年因为24年我交换结束了然后25年回来准备毕业然后当时VM社区在国内还是一片空白的状态然后呢我刚好从伯克利回来我就把这个丛林开始搭建了中国的VM社区然后呢也刚好这个就是支持了大量的中国开源模型的发布所以那个时候刚好是中国开源模型爆发的一年25年对就是25年年初的时候这个Dipsig R1嘛其实Dipsig V3是在24年的年底发布的对然后25年R1就25年年初的时候R1然后再是25年春节的时候这个RE开始爆火所以到后面也就是这个中国的开源模型就像雨后春孙一样这个不断的发布出来我觉得就是这两年确实是很多风风雨雨吧然后尤其是像刚才说到的人员的不断的变动因为我们是做一个开源项目嘛所以人来人往的就是有人参业有人参加然后又有人这个走然后我们在这个过程中还要持续不断的去面对这个新模型发布的情况 And then, we will also be able to promote the whole project and increase This whole thing is a very big challenge So, I think that I don't want to say that we do very well I just want to say that we are going to be able to win I think that 25 years is very interesting Let's just talk about 24 years You know, from V0 to V1 of the重大的重构 Because the user might feel like that Can you tell us about the future? You know, why do you do this? And how do you do this? And how do you do this?挑战这一次重构其实主要就是为了解决模型和硬件的发展对于推理引擎提出的一些新的挑战打个比方比如说我们现在经常喜欢把token比作是电这个过程中的推理引擎就像是发电机或者说是电力系统然后我觉得模型可能更像发电机我们后面可能可以做一些类比然后硬件它就像是你的像风力然后光伏这些自然资源然后这个推理系统要做的事情就是你需要把这些自然资源用发电机把它转化成电然后呢再传递到每一个人的这个手中那所以呢本次重构就好比说我这个发电系统整体上从这个火电过渡到新能源发电的一个状态那么从用户侧的角度来看呢它的使用方式可能差别不大 You can always be电 You can use this But from the推力 engine The view of the view Actually, behind the work There was a huge change So from the end user The view of the view Actually,推力 engine It's a very big responsibility It's just it's It's a hidden The design and the machine The複杂性 That user The user's different The design of the machine Just for example You're in a user And then this The user It can be used The design of the machine That from the user The user's perspective You can just From a The data 太大里面点了一个模型 或者呢你只是从这个请求的参数里面改了一个参数说 我请求的今天是deep seek 明天是签问 但其实从背后的这个推理引擎来看 不同的这个模型它的支持效率 它适配的硬件其实是千差万别的 所以这里面推理引擎承担了非常重要的任务 然后呢在这个过程中模型和硬件又在不断的发展 所以他们对推理引擎的要求其实是在不断更新的那么V0和V1只是一个我们从名字上就能够看得出来的它是一个非常大的变化但其实类似的这样的小变化我们其实一直在做所以你可以说就是VOM它其实一直是在重构的过程中然后这里面就是最困难的就是你需要保持一些用户的兼容性对吧就是你背后支持的模型支持的硬件不停的在变但是你要给前端的这个中端的用户一个比较统一的体验就是我用VOM 我就可以保证说我在各种硬件上可以跑起来各种模型 24年的时候你们是不是主要支持的还是美国的一些模型 比如说Meta 对 24年的这个开源的重心还在美国那边 欧美然后像Meta像Mistra这些的 在他们的过程中有没有什么一些观察 当时其实支持的还不算很复杂因为当时模型和硬件它还没有很偶合然后只有一些比如说一些attention算法设计的比较复杂的时候对推理引擎的影响比较大但总体上来说还是在做各种推理优化模型的结构在那一年没有发生巨大的变化到了25年是不是中国开源模型的爆发在所有人的意料之外也在你们的意料之外对 是在我们意料之外的你是几月份回中国的我就是24年的12月份结束交流然后那刚刚好碰上对就是我结束交流的时候就是Deepseek V3发布的时候对然后回来1月份然后马上RE又发布了所以是在我们意料之外的当时去支持Deepseek是不是非常的措手不及是一个什么样的状态我觉得不能说措手不及更多是说我们没有预料但它是一个这么大影响力的事情因为DeepSig跟我们的合作其实很早就开始了就是你从二三年二四年那段时间因为DeepSig它内部用的就是VRM就后续加了一些它自己优化的一个变种所以它其实从DeepSig MOEDeepSig MOEDeepSig MOE我觉得算是V1然后它后面有VR然后再发展到V3它跟我们一直是有联系的有合作的然后只是在二四年的时候DeepSig还属于社区里面的 议员就是他只是一个 闽然众人的一个模型厂商 然后你们支持他们的故事就是在 R1之后有什么值得分享的吗 这个还是给我们带来比较大的震撼的 就是Deep Seek的这个Infra同学做了很多的优化 然后我们需要学习 就是他们在推理引擎方面虽然是基于为他们做的 但是比我们做的往前面走了很多 所以我们当时是在不断的跟他们学习的过程中然后紧接又支持了很多中国的开源模型在25年对吧对对就是Deepseek爆火之后然后中国的这个开始了一个开源的浪潮吧尤其是这个25年的7月份我印象很深刻因为我事后回想起来感觉应该是当时这个WAIC快开会了然后呢很多公司都是在这之前就像发布产品像就是就是把自己有的模型都发出来了今年又处于现在这个时间点了对 And we're always in support for many new companies. We're always in. And we're already in. Like, the DeepSig V4, Minimax M3 is a big release. Everyone is going to be in WAIC before. I don't know. I don't know if you guys are in WAIC. But, but, it's been a few more, a lot of, a lot of, a lot of, a lot of, a lot of, because you said, you were in 25 years, you were in China, you were in China, you were in the VLM. It was very simple. 但是这背后是什么样的工作量 能不能讲讲这个过程 就是这个社区是怎么搭建起来的 我们也很好奇 开源社区的诞生 他是怎么就是一步一步做出来的 这个社区的搭建 就是因为这个项目本身诞生在美国 然后24年的主要的开源的阵地也是在美国 所以整体的沟通渠道也是在偏美国的 比如说我们是用slack进行沟通然后呢我们后来啊就是在国内跟大家沟通的时候就发现啊这是我们当时跟跟大家说的就是WM社区是一个很包容的社区啊那中国美国的同学都可以一起沟通啊那我们有slack的这个沟通机制那大家都可以进来啊那里面就遇到了两点问题第一点就是国内的同学他肯定更习惯说中文那么在slack里面呢大家主要还是说英文那么这是一点语言障碍然后呢第二点就是啊因为各种各样的原因那么国内的同学用国外的软件的时候还是有一些不方便的因素存在的那所以呢为了解决这些问题我们就开始搭建一些这个VOM的中文社区那比如说一些这个公众号啊小红书啊这个知乎啊这些宣传平台然后呢包括这个跟国内的一些大公司建立一些沟通和联系的渠道因为像Deepseek Kimi他们都是公开的说过他们就是用VOM的那么之前呢我们跟他们的沟通是非常少的因为这个时区也不一样然后呢人也没有办法见面然后呢我回国之后呢我就是也走访了一遍这些公司然后跟他们了解就是他们用过我们在做什么然后遇到了什么样的问题有什么样的痛点对因为我在这个24年的时候做为我们比较多然后大家也都比较认识我所以就是我就这样把大家串起来25年还有一件事就是PyTorch的基金会完成机构改革然后你们也变成了这个基金会里面一个非常旗舰的一个项目这个变化是怎么发生已经对你们有什么影响我们24年的年底就在讨论这个事情就是当时的背景就是其实这个项目的长期维护就是我们在考虑这个项目的长期维护然后呢 Stoica But we have a few people who are more Soika然后呢这个项目能不能找到一个长期的维护者都是一个问题那所以呢Yan Soika老师就说那我们就参照这个像Linux之类的项目的经验把它捐给一个基金会那么这样子能够保证它的长期的开源和维护所以就把它捐给了这个PyTorch基金会因为我们跟PyTorch的合作也比较紧密就是我们相当于是PyTorch是一个底层的机器学习框架然后呢为我们是建立在之上的一个这个推理引擎所以这个合作也比较自然但是就是PyTorch基金会它本身呢还是一个偏治理结构的一个基金会就是它不参与你的这个技术治理所以代码什么的其实还是自己要写然后呢它更多的还是就是我们把这个项目捐给这个基金会然后呢就意味着说这个项目它至少不会变成一个必源的项目就是它始终是开源的但是后来你们又成立公司了对成立公司我们是在做这个项目的商业化以及技术运维然后呢这个项目它依然是一个PyTorch基金会下面的项目就比如说PyTorch基金会下面它有好多一级的就是顶级项目那比如说PyTorch也是一个顶级项目VM也是一个顶级项目那么PyTorch项目本身他还是Meta在做主导那么基金会他可能承担了一些比如说活动的举办然后像这个VOM或者和PyTorch的商标属于PyTorch基金会所以他更多的是一些辅助性的角色所以他可能承诺的是你们必须是一个开源项目他能够保证这个事情因为比如说VOM的商标现在是属于PyTorch基金会的对吧那你不能把VOM避源了之后然后再说我支持VOM项目为什么不能属于伯克利呢为什么一定要属于一个基金会伯克利它是一个学校那么你说这个项目属于一个学校的时候你还是要从学校里面找出一个具体的人来承担这个职责的那么学校里面没有一个这样的机构Stoic老师他自己不行吗他那个实验室实验室就是前面说到就是David Patterson老师说你实验室应该只开五年五年之后你就要关掉你要开一个新的实验室所以实验室它不是一个具备这样资格的一个实体它需要一个持续性对而基金会能提供这个对基金会它是一个独立的法人实体所以它可以做各种比如说它可以注册商标对吧它可以有自己的法律团队然后呢它可以接受募捐然后呢它可以为这个项目投入各种各样的资源所以捐给基金会意味着就是你们这创始团队这些人觉得他应该做一个开源项目持续下去就是有没有可能你们也有另外一种选择因为你们后来也成立公司了就是把这个项目放在公司里一起运营这个能成为一个选项吗我们公司现在就是为我们项目的技术管理和日常运营的主要的参与者所以说我们把这个项目捐给PyTorch基金会更多是从法律上明确了它一直是一个开源项目而且它的商标属于社区但是它的具体的技术发展以及它的商业化我们都是可以由我们公司来做的当然也不只是我们公司在做还有社区里面其他的公司比如说Red Hat比如说Invidia AMD他们都在跟我们一起做技术的维护他们也可以对这个项目进行一些商业化如果这个项目属于你们的话那这个项目的所有商业化都应该是你们这个公司的实体对如果这个项目属于我们公司那可能他的商标也会属于我们公司对吧那么任何一个人他用VM他用了他的logo可能都是要向我们申请那现在他是属于一个开源项目他的这个像商标啊使用权啊都是在公共领域的我们只是作为一个技术参与者和技术领导者在引领它的发展在捐给PyTouch基金会把这个项目捐给PyTouch基金会的时候你们已经有成立公司打算了吗当时这个事定了吗还没有定所以是先有的捐赠对这个可能就是可以说到我们几个人成立公司的过程其实是相当的艰难的因为就是Yang Soika老师他有非常坚定的信念就是说这么大一个项目如果没有一个公司来支撑的话他一定会量了就是他说的就是Linux项目如果没有Red Hat的支持那么Linux不会发展到今天然后同样的像这个Kubernetes如果没有Google的支持他不会发展到今天同样的PyTorch如果没有Meta的支持他不会发展到今天类似的你还可以举很多很多的例子像Spark他要有Databricks的支持那么VOM项目它的体量已经达到了前几个项目的体量就是它的历史意义已经很明显了但是没有一个这样的公司在支持这样的项目就是有些其他的公司也会支持比如说当时Meta在用VOM然后Invidia也用AMD也用那么他们更多是一个参与者的角色他们很难做出一些战略性的决策他们之间可能本来就会打架因为可能Meta是AMD和Invidia的客户然后呢他可能会说我要做这样的事情然后呢我要啊要你们实现什么样的东西那么社区里面其他的公司可能不会服务他们所以很难在他们的领导下做这样的事情所以啊VOM项目的长期发展需要一家公司的支持这个事情是非常明确的嗯我们也都是认同的唯一需要我们明确的是我们是否愿意来创立这家公司那么这个事情其实是很难做决定的这个我可以说一下我们几个人的这个各自的心路历程就是因为创立一家公司它的优点很明显就是可以支持为我们更好的发展你们也都能成为这个公司的创始团队很好但是缺点就是说你需要承担很多原来不熟悉的一些非技术的任务比如说创立一家公司你要去学习融资对吧你要去学习招聘然后呢你还要去考虑商业化所以这里面其实是有相当大的阻力在里面的对这个路线的似乎对你们好像不难这几件事情我们就是你要考虑到我们其实都是学生团队然后我们原来很习惯的就是很舒适的那个区域都是说来了一个技术问题我们怎么拆解它然后怎么把这个技术问题解决掉那么现在要我们做的是成立一家公司然后要把这个公司就是抚养长大的感觉所以对这个路线的选择其实就是困扰了我们两年吧就是两年对啊就是因为我说就是Yang Stoica老师他是非常明确的说你们几个同学就应该开一家公司来支持VM但是从24年就开始说了对从OK对从24年就开始说了其实我觉得他应该从23年就开始说了只是23年的时候我还不在然后这里面我们几个人的选择里面我算是决定的比较早的因为我24年就是我还在交流的时候呢我们已经有很多同学在硅谷创业了然后呢我跟他们这个沟通的过程中也是近距离观察了一下这些创业者的一些状态然后呢也跟他们沟通了一下这个创业过程中遇到的问题以及这个关键的选择就是你是创业还是上班对吧然后呢也是跟一些投资人进行了一些初步的对话然后最后我得出来的结论就是即使创业失败最坏的情况下你也不过就是少拿了几年工资但是如果不创业的话那么VM项目最终没有办法长期发展所以呢我在24年年底离开博会利交流的时候我就已经下尽决心要参与VM的创业了然后呢当时因为其他几个人还没有定嘛所以我也不能自己一个人创业所以呢我做的选择是我接了这个Skylab的博士hold offer然后呢我当时说的是就是 I will wait for VM of the company to wait for 2 years Until everyone comes out to create a company So much of a thing I have a story Because I was at the end of the conversation I was also looking for I was at the end of the interview Michael Jordan talked about it And I said We now do the VM of the project It's good But if I go to find other jobs There are many people who give me a lot of money And then 做博后又非常的清贫 那这个时候要怎么选 那他跟我说的就是 从他的角度来说 根据他过来的人的经验 长期的来看 肯定是要继续支持文娃们的 就是因为我跟他也合作过很多 然后也觉得就是 这是过来人的这个 饱经沧桑的一个历史经验 然后也是 我觉得就是非常值得就是遵守 所以这个大概是我的一个心路立场就是我觉得我们最终还是要创业的然后呢现在只是实际未到所以我就先等一等所以你是第一个决定要做这件事情的人不好说我是不是第一个但我是比较早决定的然后我们的CEO Simon他也是很早决定要创业的所以我说不好说我跟他到底谁先但是我们都比较早的确定你有想过做CEO吗我觉得我可能可能他更适合CEO因为当时我们这个维护社区的分工方面他就已经展现出一些CEO相关的能力了就是在管理整个社区然后跟大家进行一些沟通所以我觉得明显他是更适合CEO的所以也就是说为什么我不会一个人出来创业因为我觉得人还不够然后这个Simon他刚才就前面说到他本来也有一些创业公司的经验嘛他已经参加过一些创业了所以呢他也认为这个就是他也认同杨索克老师的观点其实我们都认同杨紫克老师的观点就是你必须得有一个公司来支持VM才能够长远的发展只是我们当时就在犹豫说这个公司是不是我们来开然后 Simon他也在Character AI待过一段时间所以他当时尝试过通过Character AI的帮助来帮助VM项目的发展比如说从Character AI里面找几个人来维护VM然后Character AI里面找一些机器的资源来帮助VM但是最终还是发现就是没有办法靠别人因为公司有自己的事情对吧你不可能把公司里面的人无限制的耗来就是做为我们相关的事情而且始终这不是我自己做出来的东西我对他感情是不一样的对对对所以说就是你在公司里面做你只能有一个很小的团队然后类似用爱发电的方式来支持也很难说服公司的高层说我有一个正经业务的公司然后我需要全力来支持为我们开源项目的发展所以最后就是发现靠别的公司是靠不住的所以摆在我们面前的选择就是只有自己开公司然后最摇摆的是我们的CTO无数个同学对 他是Page the Center的一座对 然后他可以选择的机会太多了对吧 就是24年年初XAI刚创立的时候其实当时马斯克就邀请他去参加Infra的建设就是他如果去他就是领导XAI的基础建设那尽管说XAI现在失败了取忠人散了但是如果他当时加入XAI那么他后来能够获得的财富对吧这个是一个天文数字25年的时候Think Machine Labs创立这个时候创始人又邀请他去负责基础设施建设后来Think Machine Labs的估值也是一路飞涨所以说就是摆在他面前的这个机会属于是太多太好了所以呢他的犹豫也是人之常情吧啊最后我们是怎么说动他的呢就是就是小之以情动之以理就是最后跟他说你如果不跟我们一起创业你赚到了很多钱但是十年之后为我们项目失败了你是开心还是还是不开心啊我们问了这样一个问题然后他也想了很久然后最后发现他的答案跟我们是一样的就是你赚多少钱如果为我们项目失败了都不会开心对所以就是在这样的情况下我们把这个我们三个最坚定的人搞定了把他拉上船了然后还有很多这个其他这个信念很坚定的合伙人像这个Roger也跟我们一起做这个开源项目做了很多年然后呢还有我们是Funding Engineer就是说公司一创立的时候他们就加入进来了我觉得我们都是有一个共同的愿情吧就是大家聚集在这个公司里面然后我们都是想做AI时代的催泪引擎我们想为接下来的智能时代打好基础设施我们每个人其实都可以在市场上拿到一个很高的offer但我们最终选择了创业这条路我们希望把这件事情做好然后其实类似的这个问题其实一直持续到公司创立的前夕我们准备注册公司的时候某家顶级大厂的一号位他知道我们要创立公司了然后他就直接给我们打电话然后说你可不可以不要创立公司你来我们公司然后我们可以给你们几个人我们四个创始人然后可以给年薪2000万美元的工资每个人是吧对每个人然后说你可不可以来我们公司帮我们做我们的这个技术设施和推理反正我们当时都已经坚定了我们信念比较坚定然后就直接爽快的回去了没有一个人犹豫所以这也是我们这个创业的一点故事吧所以我觉得就是我们公司这个创立之初其实就已经是经受住了巨大的考验和诱惑我们其实都已经是并肩作战很多年的一个老战友了我在想他虽然一直在犹豫但是ACF和Thinking Machine Staff他都没去24年和25年两个选择他虽然没有决定要不要来创业做现在这个公司但是他也没有去其他公司是吗就是他去过一段时间去过哪家就包括他在GoogleGoogle DeepMind也做过一段时间就是他是一个以学生身份然后兼职的状态所以我们当时是把他从Sing Game Machine Labs拉出来的这很有意思为什么他作为Page Attention的发明者然后是他的算法然后导致了有VLM推理引擎的诞生但是他很犹豫而且为什么李卓汉没有加入 李如还没有加入是因为他毕业的比我们早 他24年就毕业了 那个时候就是他如果创业只有他一个人 因为其他的同学都是学生 然后呢学生是非常廉价的 就是你只是要有吃有喝 然后有电脑有网你就可以干活 你觉得没必要开公司 所以那个时候他也拉不动其他人 所以他就去工作了 然后他在OpenAI工作 然后后面包括在Meta的TBD工作 所以他已经有工作了 而且已经工作了很久然后呢他就有自己的事情要做你们有尝试把他也拉过来吗比较困难吧因为确实他已经在公司里面做了一些事情了然后就是你把人家拉过来是要影响到别人原来的团队所以这个事情还是比较困难然后呢无数个同学还没有陷入太深就是我们觉得还有机会拉回来你有这样的offer吗你有动摇怀疑过没有除了最后你们创业 临门一脚的那个添加offer之外 在之前呢 对 因为我决定的比较早 所以我前面说我接了postdoc offer 所以我其实没有看其他价的offer 就是我跟大家聊都是在说 你们用VM然后怎么用的 然后大家一起看看怎么合作 没有跟他们说 你要不要我去你的工作 然后你给我多少钱 你有想过这个可能性没有 你在脑子里推理过没有 推理过 但是还是那句话 就是我们觉得VM项目比较重要 我们都想做成它 这是同样的一个问题 我们四个人吧 就是浙汉 乌苏和Simon和我 我觉得答案都是一样的 就是如果我们自己赚了很多钱 但是为我们项目失败了 我觉得我们都是会后悔一辈子的 所以我们都比较坚定 就是要把这个公司开出来 跟你浙汉还会有什么样的合作吗 因为他现在在公司也有自己的事情 所以跟我们很难有很深入的合作 更多可能是有一些这个high level的一些技术的沟通 对 我觉得从你就是你们包括跟PiTour是基金会的关系 然后包括又开公司 就是我其实一个开源项目 我觉得他的整个运作跟可能外界想象还是非常不一样的 而且一般大家讨论的也比较少 你能不能讲讲就是像这样一个开源项目和大家想象的很有可能最大的不同是什么以及它是作为一个组织是怎么构成运转治理的呢不同的开源项目它其实有自己的这个治理方式我这里只讲这个这边的治理方式那我们采用的是就是常用的这个分级管理的方式我们有几个我们叫做仁慈的独裁者就是可以最终拍板的所以你们几个吗对就是包括这个Simon Wusuk我和这个卓汉然后还有Red Hat的一些同学仁慈的独裁者OK那就是说我们平常跟大家沟通都是心平气和的沟通的但是如果有重要的决定要拍板或者说我们有的时候有一些比较强烈的坚持的时候那这个时候大家得听我们的所以这个是比较决策的几个人然后呢我们还有十来个就是日常的核心维护者那么他们都负责项目里面非常重要的一些模块然后呢会参与项目的日常的一些关键的设计然后呢我们还有大概几十个committer然后呢他们主要就负责日常的代码的开发然后呢剩下的就是这个社区的贡献者因为VM现在它是PyTorch基金会旗下的一个顶级项目所以它也接受PyTorch的一些治理结构那这里主要就是一些大公司的这个参与治理比如说像这个英伟达AMD这些重要的芯片厂商然后包括像Red Hat这些软件厂商然后呢包括像亚马逊啊 Google啊这些云场上他们都会投入相应的资源在维护WM所以呢我们作为项目维护者的这个职责之一也就是协调这些大公司之间的这个合作然后当然我们现在有公司就是所以我们公司也是WM项目这个治理过程中的一个不可替代的一员在有公司之前因为我听过一种说法就是这种开源项目更像一个社团而不是一个公司你们是有什么样的比如机制吗比如说例会等等你们日常的沟通是怎么来完成的对我们是有一些例会的就比如说我们几个决策的同学可能每周要碰一下然后这个 committer我们可能就碰的不会那么频繁我们更多是在一些这个channel里面去聊他大概是一个就是每周可能碰一次你们几个人对决策的同学要每周要碰一下就是接下来要做的一些重点的事情你刚才说你们是仁慈的决策者吗你们有做过非常强硬的决策是什么就必须要这样 人词独裁者 对 人词的独裁者就意味着有些时候你需要对方向进行一些取舍 就是不能够做一个老好人 那这里面比如说我做的比较强硬的一个选择 就是基本上把一个叫做beam search的功能从引擎里面删掉了 这个其实持续不断的有人会来跟我们抱怨 尤其是做推荐系统的同学 他们的经验是他们觉得beam search在他们的场景里面比较重要但是我们从这边看到的情况是大模型的推理就是AI这一边我们主要的workload它的推理形式已经不再适应Beam Search的这种算法的发展了所以Beam Search的算法如果我们持续要维护它的话只会给模型和推理引擎的适配带来越来越多的复杂性不可维护所以我就把它删掉了这是你做的一个独裁决策对还有其他这样的决策吗其他的我觉得就更多是在一些这个支持的优先级上面了就是因为项目这么大你最重要的事情就是定好优先级那么你需要支持什么以及不需要支持什么不想支持什么那么比如说我们现在支持的优先级明显是在大级群上面的大模型的支持那么很多非常小的模型的支持我们就没有把它列为高优先级的事项比如说几百兆的模型其实推荐系统里面有些人是在用的那么现在我们给他的说法是你可以用但是如果你有这方面的性能优化的需求我们并不会接因为你们现在有很多贡献者应该是2000家管理这么大一个规模的开源社区你觉得挑战是什么对我觉得最大的挑战就是刚才说到的就是你要梳理事情的优先级要做什么更重要的是不做什么然后当一个项目有2000多贡献者尤其是最近今年Coding Agent的发展特别火所以贡献代码这件事情已经变得非常简单了所以我们在作为项目管理者的时候我们最重要的要做的事情是要屏蔽噪音要找到真正值得做的事情然后引导社区往这方向发展这里面有一个数据就是2025年的时候Github发布了一个统计数据就是按照贡献者的活跃度来排序 VOM是整个GitHub上面最活跃的项目一方面我们也很荣幸另一方面其实也给我们带来一些我们叫做幸福的烦恼比如说今年五月份的时候我们发现有部分培训机构通过提交垃圾代码的方式来包装学员的简历就是他提交一个没有什么用的PR然后想要合并到VOM里面然后他就可以在学员的简历上说我是VOM项目的贡献者然后希望通过这一点来提高学员的简历通过一些面试的概率这个其实对我们来说是一个非常大的变化就是它彻底打破了我们对于开源社区的用户都是善意的这一基本假设所以我们现在就只能引入一些认证机制比如说我们会更多的重视来自一些知名机构的贡献我们会忽略甚至拉黑一些看起来就很像机器人的账号比如说他十分钟之内给你提交了20个PR 这种人一定是机器人 而且他提交的东西没有任何的人力的参与 就全都是coding agent 我们叫做AI slop 就是完全没有营养的东西 所以你可以放心的把它block掉 所以我觉得随着这个AI和coding agent的发展 未来的这个开源社区的演进方向 他会更多的掌握在机构和这些重要的贡献者手中 一些个人贡献者他能做的事情其实会变少整体上来说代码变得如此廉价以至于维护者他花时间去看别人的PR不如说他自己来让coding agent再写一遍然后他自己还有更多的context说我想让coding agent怎么写所以我觉得以后开源社区会更加的重视反馈那么社区他会变成维护者和用户这两个部分用户你就只需要提交bug report或者feature request你只需要说你用的过程中遇到什么问题了或者说你有什么其他的想用的东西你就不需要贡献代码了然后只需要这个维护者自己来贡献代码就可以了你觉得这是BLM这一个社区的眼镜方向还是很多可能现在社区的共同的眼镜方向我觉得这个是开源社区的整体的眼镜方向就是coding agent的这个发展尤其是今年在写代码能力上的突破确实是远超我们预期的所以这个对于很多开源项目的这个维护都造成了类似的问题这个就是PyTorch的一个核心维护者叫做Edward Young然后呢他也写了一个类似的博客就是说我们现在已经没有精力去看大家的PR了所以与其花时间去看别人的PR不如我自己重写一遍你们跟OpenCloror联系多吗他们现在社区维护是一个什么样的状态他们的治理方式跟你们类似或者不同吗OpenCloror感觉已经变成了 I think it's a simple way to do AI.它不是来解决现有的一个问题它很多时候是解决接下来将要发生的问题比如说我们要解决我们要支持接下来三个月内要发布的新模型所以我们在维护代码的时候我们不只是看它如何支持现有的模型我们脑海里还必须想着接下来三个月支持的模型在这些代码里面怎么支持以及包括接下来半年接下来一年要推出的这些新硬件要怎么支持所以我们这个项目维护的过程中必须是带着大量的个人的context去做的所以这一部分目前还没有办法交给AI去做我听你在讲这个时候我在想是不是一个开源社区发展它的成语拜也好跟创始团队在不在会有很大的关系对就是创始团队需要在这撑着如果这个主要的就是团队的主心股发生了变化那肯定需要会有一个这个阵痛期就是他需要转型他需要适应所有的合作伙伴都需要去适应他的新的领导有这样换过领导了还发展非常好的开源社区的先例吗我觉得换过领导之后这个项目基本上就很难发展的很好你怎么看OpenCloud的未来的发展我觉得Coding Agent的发展给大家带来一个虚拟的假象就是觉得好像所有的软件都变得很容易写但其实有一些顶层的系统设计包括长期的维固还是需要人来设计的就是我觉得AI它可以帮我们走完90%的路程但是还有10%的关键的那个画龙点睛的那一部分是需要人来这个提供支持的需要提前预判定层设计对因为我看开源社区的这个比较少就是一个开源社区的成功也好失败也好有哪些历史先例就是最后可能导致比如说一个社区分裂萎缩失败可能包括会有哪些因为你们伯克利的这个渊源的原因你们见过很多吗当然我觉得第一重要的就是这个开源项目它确实是在解决一个大家都关心的问题这个是最根本的如果你解决的是一个没多少人关心的问题这个项目它就长不大这是一个根对这是一个根基然后第二点就是有了这么一个重要的需求之后那么能不能撑起这样一个项目这背后就涉及到刚才我们说到的需要有一个创业公司在背后运营这个项目去组织这个项目所以这也是很关键的一点然后呢我觉得就是像这个创始团队持续在推进这个项目这也是很重要的一点然后呢我觉得就是有了这些天时地利人和吧然后就是把这些事情持续推进下去你们为什么那么执着一把WuSuk拉进来你跟SAMO两个人不行吗他还是我们之中比较偏技术的同学就是很多因为很多历史上的技术角色都是他做的所以他来做的话会有比较好的延续性所谓根正描红它可能是那个根就是第一个人对得在那里对我觉得这个对于社区的这个号召力也会有比较大的影响有你见过那种非常可惜的开源项目吗就是他可能根很好但是因为后期维护出了问题然后最终导致失败了我觉得这些还是有比较多的例子的尤其是就是一些开源社区他没有公司在背后支持这个比如说很多历史上的很著名的项目其实都是很多人在就是有几个人在艰难维持比如说像这个OpenSSH这个其实是大家都要用到的一个这个计算机的基础设施就是一个这个SSH的这个加解密那么他的维护者其实就只有那么几个人在自己维护然后呢这个事情是直到这个大概十多年前出现了一次事故就是他的一个漏洞被人破解了导致可能全世界都在裸奔就是你的密码可能大家都能看得到出了这个事情之后大家才成立了一个基金会然后给他投一点钱来这个支持他的维护所以其实开源社区的这个基础设施建设 uh一直是一个老生常谈的话题就是他们都很重要但是直到他们出问题之前大家都觉得不需要投入你们还是提前来做了这件事情的对我们提前做了这个事情而且就是伯克利这边的历史源源表明只有有这样一个创业公司在背后支持这个项目才能够健康的发展一定得是创业公司对吧不能是一个大厂对我觉得得是一个创业公司如果是一个大厂的话他很容易带来这个大厂原来的一些偏见或者说立场那这个时候他很难去融合这个社区就是可能有别的大厂不服他所以说所有人不会跟他一起走那么这个创业公司又是这个项目的创业团队然后呢在社区里面带着大家一路风风雨雨这样走过来那我觉得他的号召力包括他的这个中立性公正性大家都是比较认可的所以我觉得这样的项目可以就比较promising最终你们觉得这公司可以成立的节点是什么是乌斯大英加入的那刻吗有没有那样的一个时刻那样的时刻我觉得就是就是Yang Soika老师告诉我们说这个公司再不成立这个项目就要完了几年几月几日可能找不出一个具体的时间但是应该是25年左右的时候因为25年左右的时候我们做的一个主要的任务是做大模型的大规模的集群级别的部署这个时候我们其实遇到了很多问题一方面就是说人力资源的问题我们在以开源社区的方式运作的时候参与这些事情的人都是不确定的人来人往的有些人新加入有些人离开 feature We have some 因为我们经常做很多新模型发布之前的支持 包括新硬件发布之前的支持 那么在这个过程中呢 对方法务经常会要求说你需要有一个我们叫NDA嘛 就是保密协议 对吧 那这个保密协议谁来签 这是一个很尴尬的问题 因为开源社区它不是一个实体所以对方的法务经常就会说你背后是哪些人在做这个事情然后呢他可能还会还会需要检查说你这次来做的是这些人下次来做的可能是另一些人那么这些人里面变动的人里面有没有我的竞争对手我是不是要对他进行做一些背景调查才能够允许他来接触这些信息对吧这些其实都是一个开源项目没有办法完成的事情然后呢再包括除了人力资源之外还有机器资源的问题那么我们做大模型的大规模部署其实在24年的时候这个事情为什么没有这么突出因为那个时候模型还比较小然后你搞到一台机器单机的单卡的就可以做很多事情了那么那个时候也有一些公司比较热心慷慨的给我们捐赠了一些机器但是到了25年的时候因为整个的规模上去了我们要做的很多优化都必须是集群级别的我要别人给我一个集群的时候就很困难了就他给我一台机器已经是顶天了这是他能支持的最高的力度然后呢我们这个时候为了做一些这个集群级别的优化我们就只能去各处乞讨然后呢我可能我首先需要花一个月的时间劝对方说给我这些机器然后呢我拿到了这些机器之后我需要马不停蹄的规划说我今天要做这些事情明天要做那些事情因为可能我这些机器一个月之后就到期了然后呢对方给我这些机器也不是一个promised的事情他们内部如果有一些紧急项目他是不是接下来比如说我一周里面我135我可能我要自己拿过来用然后246给你用甚至可能紧急通知你说接下来一个小时我马上要用对吧所以这些事情就给我们带来很大的阻碍所以我们25年其实我觉得说实话我们做的不是很熟那么这些事情就导致了我们已经很明确的看到没有一个公司的知识这个项目已经无法继续往下发展所以你们有点不得不 that you actually always wait to create a company right the whole thing of the situation is I already have no need to create a company and I always wait to create a company so I always in the middle of the call I always say we're going to say we're going to see now we're going to get this problem the people who need to call us we're going to call a company and we're going to have a company and I'm going to say this and then the last is 25 years because we're all in that year So we said, we should go to a company. You said this, Simon would say how? Simon would be the same. And then, Wussuk? Wussuk still in the same way. The last thing he was going to do, was he going to do that at the moment? Did he do this company's company? Did he do that at the moment? Yeah, he was going to do that at the moment. Because he was going to do that. We were going to do that. He said, if he didn't do that, we did it. And then, you think, if you think,如果你不来的话导致为我们项目失败虽然你赚到了很多钱但是你会不会快乐然后对就他想了几天然后最后回来了他当场没有给出答复对我觉得这个问题一旦问出来是我们双方都需要冷静一下的时候那是几月份去年可能是快到七八月份八九月份的时候了吧然后到年底就开始成立公司了对就是我们最终把他劝回来之后那我们还有各种流程要走我们还要去找投资人聊融资的一些事情后面顺吗在面对你们觉得可能自己最不擅长的那部分的时候现实是什么样的我觉得这部分还是比较顺利的就是因为硅谷的VC对我们整体是一个期待已久的状态就是虽然我们决定成立公司是在2025年的年底但其实他们23年24年的时候就已经在跟我们接触了而且那个时候就已经在给我们开源项目提供资金了所以我觉得这里可能可以重点讲一下比如说像ACC他们在二三年的时候就给微玩项目提供了一笔资助这个是资助对这个是资助是单纯资助给开源项目发展然后呢这个钱金额会多吗一般来说当时应该是几十万美元的级别对然后呢这个像二四年的时候 Sicoya和真格这两家也都给我们以开源社区的形式给我们捐赠了一笔钱所以他们其实很早就注意到了我们而且也跟我们一样认可为我们是一个很重要的项目所以他们愿意投入一些早期的资源来支持我们当然他们也是说如果我们创业的话肯定是大力支持我们所以当我们最终把这个消息说我们几个人最终决定要创业了我们要有一家公司这个时候我们再去找他们的时候他们其实都比较爽快都说其实我钱已经准备好了所以这个你们终于决定了对他们一直在等我们所以虽然我们种子轮融到的资金比较多但整体上还是投资人在主动找我们要投资的阶段就是我们即使种子轮融完之后直到现在其实也不停的有人在说我这里有很多钱我可以直接给你们就是几千万美元的这个save都可以直接给你们然后你们下一轮融资的时候把我们考虑进去但是我们现在还是一个谨慎乐观的态度就是我们希望把这个融资和公司成长的速度相匹配就是我们不是为了融资而融资不是说现在有钱我就要去拿更多是看我们这个公司现在发展到了什么阶段然后需要把钱拿来做什么事情然后再去看下一轮融资你们应该是全球来说 AI infra领域融资 总资论融资最多的一家 是不是 没有做过横向的 这个历史的对比 但应该确实是比较大的 投资人为什么这么看好你们 我觉得 核心还是我们在 这个生态里面的地位 就是当你去 看这个开源模型的 生态的时候 每一个模型的发布 背后都跟着威蕴们的支持 每一个芯片厂商都会主动来靠近Volum说他希望得到Volum的支持那么这背后的市场其实是一个多少逼练的市场所以其实给我们的投资相比于我们产生的价值来说我觉得并不算多其实市场也准备好了然后客户也准备好了但是就等你们几个人做决定对就等我们要做这个事情当然如果我们不做可能有其他人来做但是不一定有我们这么好的站位出来以后你没有说我们应该更早出来就好了吗因为其实融资比你想象中可能容易很多确实但是这个可能就属于马后炮了以及再往前面一些时间其实我们也没有那么多时间就是我们比如说在准备一些毕业什么的事情然后也没有时间来做这些事情所以更多是在像7月份我毕业了然后秋季学期 Wushuk和Simon他们也都快毕业了所以刚好是这么一个时间点其实我已经是在不断的催促说我们该创业了你是为了创业去接的教职吗对我是为了等他们创业而接的博士后所以我一直在不断的催促说我们应该创业了再不创业又有12345这么多条问题你们几个人是怎么分工的包括Young Stoic老师他扮演个什么样的角色 Young Stoica老师是我们的创始人之一然后他现在属于一个advisor的决策就是一些重大的战略决定我们都会问他因为他有很多的创业的经验他包括他是Databricks的创始人然后也做过像最近的LM Arena所以他对整体的行业的水温都比较了解所以他会给我们一些建议说这个阶段这个公司我们现在该做什么事情了接下来该做什么之类的所以他给我们一些这个high level的一些建议然后呢我们主要创始人这个四个人里面呢就是更多的还是就是有什么事做什么事吧有技术的就做技术然后有非技术的就做非技术然后看谁有更好的context来handle这个事情对比如说有些公司原来是我对接的那么对方再来找到对接 那就我去出嘛 然后有一些事情原来是像无数个在做的 那么现在这个事情需要继续往下推进 那么就他去做 所以我们 就是我觉得我们四个还是比较 四位一体的状态 就我们四个人可能是 同样的一个共享一个大脑 然后只是需要谁的时候谁出嘛 还是仁慈的独裁者嘛 对 我们四个一起吧 也还是仁慈独裁者 对 And then we do the things that we have no overlap. It's different from each other. We have to take a look at the things that we have. So, this is the direction that you have to take. And if you have a strong opinion, you can do it. Everybody支持 you. When you have a project on the internet, the community's infrastructure will have some change? It will be a change in the community? I don't think that's it. This is the thing that we have to do with the community. is a good thing because they actually are in期待着 we're going to open a company just like刚才 said we're going to do with many of the partners together对吧 so they want to we簽 a safe agreement that no company then we can't then we can't there's no company after we can with them they can't they can't they're very happy and then there are there are some companies just just just just just just just just just just just just just对方说我们合作一起做这个事情你能不能给我们一些算力支持对方也很尴尬因为公司里面的算力都在公司内部他很难给我们公司外部的人支持他最多就是可能像刚才说到的有些公司给我们提供一些资金的支持但是我们要去买比如说资金放在谁的口袋里都是一个问题对吧我们不能直接放在个人的口袋里然后你去买一些东西的时候比如说买算力的时候对方可能也会要求一些资质的证明 你是不是一家合格的公司 对吧 所以说这些东西 其实在我们成立公司之后 都得到了很大的环节 而且我们有了公司 有了人力资源的支持 有了硬件资源的支持 我们可以把很多 原来做不好的事情做得更好 那比如说我们可以招聘更多的人 来支持为我们项目的发展 然后呢我们也可以有更多的 机器的资源来验证我们原来 验证不了的事情 所以整体上来说 对社区来说是一个非常大的促进那社区对于一个开源项目的这个意见他并不是说他能够在这个项目里面能够写多少代码或者说他在社区里面说话有多少人听更多的是说这个项目能不能给他带来一些收益比如说新模型发布的时候这个项目是不是又能够支持了然后新硬件发布的时候这个项目是不是又能够支持了然后一些新模型这个特性新的推力引擎特性的发布的时候这个社区是不是又能够支持了所以他们更多是一个从用户的角度来看这个事情那么我们公司的成立对为我们项目的发展尤其是对用户来说是一个很好的事情因为这个项目现在更有保证了然后各方面的也发展的越来越好了所以他们都是非常支持我们做这个事情的如果当商业客户和社区的需求发生冲刺的时候你们会选什么我们不接这样的商业客户我们现在是供少于求的状态就是我们能支撑的商业客户远远小于想跟我们做商业合作的客户所以我们可以非常爽快的拒绝掉我们不想做的事情所以我们目前做的事情都是跟社区发展一致的事情最终还是你们四个作为一个决策者主要是我们四个在公司里面决策那PyTorch基金会现在跟这个公司是什么样的一个关系PyTorch基金会就是他在我们项目的日常的管理过程中就是他不参与技术管理所以我们目前主要是可能每一个季度会向PyTorch基金会汇报一下这个项目做了什么然后呢其他的没有很多别的他只是一个象征性的意义我感觉他作为一个持续的开源项目来存在对就他是那一道保险杠保证这个项目他不会避原对然后具体的技术都是我们自己在做你们对开源避原这个问题上没有过争取或者是犹豫对吗没有因为如果我们想做避原的话我们就可以自己去找家公司做了就是我们觉得这个开源推力引擎它是很重要的事情而且需要坚持下去你们公司为什么叫Infract对起名字是一个相当困难的事情我们为此讨论了好几天然后最后取名Infract也是因为我们公司主要做的事情是想做Inference所以就有一个Inference在里面然后配套了一个我们希望是Bring Inference into Action就是把推理做到行动里面 Just let it go. So, it was finally the name of Infraact. You think this company 10 years later will be what? What are your goals and goals? 10 years later, it's been quite long. We already had a lot of time. AI will develop a certain extent. But our goal is Infraact to make the big thing to do a basic solution. It's just that大家想起推理就会想起VM然后想起Infraact那商业模式会是什么样商业模式的话我们整体还是就是围绕大模型推理技术和VM的生态然后呢一边建设VM的生态系统一边去做商业化所以我们在探索好几种商业模式那比如说我们公司可以有机器然后有软件我们最后就给大家提供一个叫做Endpoint Service就是对方只需要直接从我们这里 用token就可以了 我们也可以再探索一些像 我们叫做BYOC的模式 就是你可以客户有机器 然后我们提供软件 然后我们产生token可能是给你内部 自己用 然后也可以是一些纯生态合作伙伴 类似的探索性质的 就我们跟一些战略性的客户 一起去探索 怎么把WM的生态建立的更好 这方面也可以有些商业合作的机会 整体上来说 我觉得就是我们希望做到一个 uh,按量收费的状态,就是我们不是技术外包,我们不是在售卖我们工程师的时间,我们产生的价值,取决于我们为你多产生的多少token,为你的这些机器又节省了多少成本,所以这个是我们一个整体的逻辑,嗯,现在公司多少人?我们现在公司大概30多人吧,接近应该快到40了,我们还在持续的招人,再从一个像社团的一个组织, 变成公司这样的组织的过程中 你们有没有什么感受 或者knowhow可以借鉴 我觉得公司确实还是挺不一样的 就是我们之前在做开源社区的时候 一个很困难的事情就是 你没有办法从上到下的去强制推进一些事情 就是你没有办法去规划 因为这些公司这些参与的同学 他们都可能有自己的工作 所以他们不是全职在做这个事情的他们可能内部有一些其他的比如说紧急的事情那么今天就来不了了所以我们只能是一个best efforts或者是一个许愿的状态就是我求求大家这周把这个做完对吧然后现在我们有了公司了这些同学都是我们的全职员工了对吧然后我们也有专门的资源可以去推荐这些事情了那么我们可以引入更多的计划我们说我们这个季度要完成什么事情然后分给这个小组你这个小组你接下来这一周应该要做什么事情就是我们可以有更多的计划那你们几个人的关系有没有发生什么样的变化就是我们几个创始人之间都是就是每天都会同步一下一些相关的事情所以我觉得关系应该还是更紧密了就相比于之前开源社区的时候大家可能像同学对然后开源社区的时候可能沟通还没有这么紧密因为那个时候可能大家都是松散的组织在一起的状态然后现在大家是为了共同的一个目标 然后大家可能都需要看这公司里面发生了什么事情,然后大家需要一起来解决。 Infraact这个公司今年的一些规划会是什么? 今年的规划我觉得目前还是在聚焦这个开源大模型推理的生态方面,那么包括接下来即将要发布的一些下一代的这个推理引擎,包括这个下一代的模型,下一代的硬件怎么样做到更好的推理然后包括针对下一代的负载就是大家怎么去用这个token的这些东西我觉得我们需要用开源的微网给出一份满意的答案好 上面我们回溯了你的研究历程以及这个公司从一个开源项目走向公司化的过程那今天我们其实还也很想跟你聊的一个话题就是模型与infra的co-design我觉得你们非常擅长也是现在很多模型公司都很关注的一个话题我们先从一个最基本的开始聊起如果是一些给一些非技术背景的观众或者听众解释模型结构与Infra的co-design你会怎么比喻他们为什么需要在一起设计我们现在很多人把这个token比作电力对吧然后我觉得可能可以从这个比喻开始我们可以把硬件就想象成这个自然资源就是你比如说不同的地方它有这个不同的风力和不同的水力还有这个光伏太阳能然后呢模型我觉得可以把它比作是一个发电机那么有这种大风车的这种风力发电机也有太阳能的那种光伏发电机也有这种机械式的这个水力的发电机然后推力引擎就可以把它比作是这个电力系统那么它把这个模型跑在硬件上然后最后再把 token发送给用户分发到千家万户那么这里面的co-design的程度它其实就决定了它的发电效率那么比如说有的地方水流比较湍急有的地方水流比较平缓那你在这两个地方怎么样去设计你的发动机使得你的发动机能够更好的利用这部分能量这个就是所谓的模型和infra的co-design就是在同样的自然资源的情况下配上可能不同的发电机然后它有不一样的发电效率对直觉上来看的话推理效率可能是系统工程师的事情它跟模型算法的关系是什么我觉得要讲清楚这个事情的话可能就要讲清楚一个概念叫做hardware lottery就是硬件彩票这个也是应该不是David Patterson是另一个学者写的他说的是在几十年前还是摩尔定律比较有效的时候那个时候其实软件和硬件的发展基本上是一个各自为战的状态那么你写软件的人你其实不需要考虑那么多硬件的特性因为硬件的通用性能它每隔两年就翻一倍然后软件的性能自然的就会跟着变快但是现在的问题就是摩尔定律的黄金时代已经结束了就是你没有办法再通过制成然后得到通用性能的提升所以现在其实已经进入了一个专用时代就是英伟达经常说这个皇室定律就是说你的算力可能你每隔两年又会翻几倍但是这个算力它其实都是专用的算力就是它没有办法做到通用那所以如果你的这个算法没有利用到这些专用的算力你就没有抽中硬件的那个彩票你就吃不到这个时代的红利比如说我觉得就是这个机器学习非常资深的这个Hinton老师他当时强推了一个叫做Capsule Network那个东西就是他觉得从概念上非常make sense但是那个东西在GPU上不友好所以他得不到广泛的应用或者说至今他没有得到广泛的应用如果他需要得到广泛的应用可能需要一个专用的硬件所以说就是模型的结构它决定了推理效率的一个上界如果你的这个上界太低了那系统工程师就无力回天了对吧你已经做成这个烂样子了那它再优化也就是这个样子所以你必须得把两者结合起来看其实Transformer就是抽中了GPU的彩票对可以这样说因为它非常适合并行这个并行指的就是它里面有大量的这个矩阵乘法那应该是算法领着硬件走还是硬件领着算法走理想情况下这两个肯定是要协作的但是实际情况是因为硬件它已经造出来了所以很多时候是算法需要去学习硬件的发展当然硬件一旦走错了它就几年的时间它就走错了这对硬件公司来说是一个巨大的挑战所以它需要不断的踩着时代的脉搏去压住下一个有用的硬件长什么样子但是一般来说 So I think the idea is that the model and the model is fit. The model is fit. Can you give a specific example? Because the model is good, so it will cause the effect of the infrasal effect. A more famous example is Rope. The word is called the way to write. Transformers came out after the word, I think it's possible to find a lot of the way to write. But they have to do a lot of the way to write. They need to修改 the core of the focus of the focus.就是你的位置编码变了那么你的注意力 kernel需要重新写那比如说叫做一个叫做alibi的这个技术它是这个absolute的这个position bias所以它就没有得到广泛的应用那rope流行起来的一个很重要的原因就是随着训练长度的这个提升那么大家需要位置编码然后呢同时又flash attention解决了训练长度的问题所以flash attention就变成了一个训练必须的东西然后在这个时候你的大部分的用户是没有办法就没有那个能力去修改flash attention的所以这个时候大部分需要修改attention内部实现的位置编码就被干掉了就没有人去尝试了而rope它的好处在于它是一个绝对位置编码就大家希望是一个绝对位置编码但它同时又是一个相对位置编码但是它是一个以绝对位置编码实现的方式所以它有非常良好的性质而且它是可以把它独立注入到这个Qray和Key里面它是独立在Attention之外的就你可以在Attention Kernel之外独立的做这个Rope所以它跟Attention Kernel是互补的所以它就变成了一个最佳搭档所以说就是模型结构设计的好那么它就可以跟Infra有一个Code Design就是一个共鸣的效果就大家可以互相提高能够有一个更高效的实现那么你的整体的训练推理效率都会提高很多因为提到Infra大家这一代大模型公司里就会说Deep Seek是Infra做最好的它的Infra做的好是跟这个模型结构和Infra的code design有关系吗对 我觉得就是Infra的就是Deep Seek的Infra团队我觉得可以说是全球顶级的团队是不是第一我不好说这个可能见仁见智但是绝对是顶级的然后Infra的能力强也就能够高效实现的模型结构就更多所以他们的算法研究员就可以更快更充分的去探索各种选项然后这里面我觉得还有一个他们的算法同学其实也都是懂一部分infra的比如说在24年年初的时候就是当时Deepseek探索MOE就是Deepseek MOE那一波那么其实是Deepseek的一个算法同学写出了这个MOE的当时还是比较粗力度的MOE的一个比较高效的实现所以他们其实在探索MOE方面infra探索了很多然后包括后面系列度MOE也是他们在推理系统里面第一个做出来的所以说infra的能力对于DeepSig同学的算法探索起到了非常重要的作用同时他们的算法同学也会学习infra的知识使得自己的算法设计能够更infra的友好所以应该是算法主动去靠近infra算法需要主动去靠近infra然后infra也需要对算法有一些基础的了解我觉得这两者需要更紧密的合作这两者需要比如说一起办公有什么样的机制能够让他们更紧密吗还是说我从招人上就应该算法的人懂infrainfra人懂算法我觉得招人的时候如果能招到既懂算法又懂infra的同学这个肯定是非常好的然后后期的组织结构上面可能确实一起办公会更好一些比如说一起办公的同学大家日常的讨论infra的同学每天讨论的是什么事情那么算法同学耳濡目染的也就知道了原来我有这样的一些东西要考虑然后算法同学一些日常讨论infra同学也是耳濡目染的就是会有一些潜移默化的影响对比如说如果infra团队太主导他有的时候也会忽略到算法上面的一些事情比如说这个MOE里面那么就曾经出现过一些Infra同学为了这个MOE的均衡而选择了exper choice的这个事情那么这个事情在算法上面其实是不能被接受的但是在Infra上面你可以让他跑得很快所以这也是一个Infra和算法过度倾斜到Infra的一个例子这两者谁的话语想可能可以更高一点我觉得很多公司里面是算法的话语权更高一些然后Infra很多时候是一个被动接收的状态但理想情况下他们两个应该co-design怎么说呢这个就像刚才说的模型和硬件co-design一样理想情况下他们都应该是co-design的但是现实情况下是硬件更强势一些因为它已经设计出来说到DeepSeek他们最近DeepSpark也刚刚发布那么从旁观者的视角解读一下最新的技术进展Despark它是一种新的投机解码的方法因为自回归的建模的大模型它的推理整个就分为预填充和解码两个阶段那么预填充它是处理用户的输入然后解码阶段它是处理模型就是自己在输出然后因为它是自回归的所以你模型解码阶段只能一个一个投根的生成效率比较低然后投机解码它就是说我根据当前的输入一次性的猜测我接下来要生成的几个token然后把解码的过程变成一小段一小段的预填充的过程那么它一次性可以处理多个token就可以提高处理效率在Dspark提出之前业界其实已经研究了很多的投机解码的方法比如说常见的Ego以及同样是Deepseek提出的MTP的投机解码他们的特点就是猜测的长度比较短一般可能就猜测三到五个但是接收率比较高那Dspark的技术路线属于是Dflash的系列那这一部分我们其实最近几个月也都一直在关注所以Dspark它不算非常新颖的内容Dflash路线的特点就是它一次性会猜很多个Token比如说16个Token那我们VM和Invidia其实最近刚刚发布了一个技术博客就是在介绍VM里面的Dflash的支持这样的话可以对某些模型达到每秒上千Token的速度 D-Flash的缺点就在于他猜的token很多但是他猜错的也很多所以他模型验证过程中存在一个算力浪费的问题D-Spark对于D-Flash的改进就是说估计一下这些猜的token里面哪些是准确的哪些是不准确的然后大概率不准确的token你就不要再去验证了所以比如说模型猜测了16个token你简单统计一下模型最后输出的一个自信度可能发现只有前8个token是准的那你就只需要验证前八个token就可以了所以说Dspark大概是延续着这个路线在改进Dflash那Dspark对我们来说其实并不意外就是因为我们已经做了几个月的Dflash相关的优化了然后呢Dflash的这个接收率的问题也是Dflash的研究圈子里面的一个共识然后像在Dspark提出来之前呢腾讯的会员团队其实已经有发布了一个Dcut工作然后上交的同学其实也有提出一个叫做domino的工作都是通过类似的思路来解决这个问题的所以说你说Dspark在算法上面有多么normal我觉得并不能算很normal我们跟DeepSig团队跟腾讯会员的团队也都有很多的沟通大家很快也会看到VM里面支持这些算法但是创新性是一回事然后能不能把创新的想法扎实的做出来这又是另一回事我觉得Despac是继承了Deepseek一如既往的非常扎实的Infra的基础把推理优化压榨到了极致这也是我们在跟他们学习的一点就是怎么做到更好的推理优化然后其实这个也是另一点就是算法跟Infra co-design的部分就是有没有一个好的推理引擎上的实现是决定一个投机解码算法能不能大规模使用的一个关键那Deepseek的推理引擎团队非常强悍 So we also want to research the design team and to the research and to provide more information and more information This is a co-design and an example Yes I think everyone will say he is a very good infra of the people of course He will have a good infra Why do they do it? What do AI do? Infra I think it's not a good I think I don't know AI infra They're they're they're I don't know some of AI of the because you have a very good idea