2026年9月,国产大模型企业密集发布了最新成果。
9月21日,阿里巴巴在云栖大会开幕前一天确认,1993年出生的刘大一恒出任ATH事业群TokenFoundry Qwen大语言模型项目负责人,其在主论坛的演讲顺序仅排在阿里集团主席蔡崇信、CEO吴泳铭之后。
9月22日,同一场大会上,1992年出生的陈宇森以阿里巴巴集团副总裁、千问办公CEO身份首次公开露面。
此前,他从长亭科技创始人转变为钉钉CEO,再调任千问办公事业部负责人,职级从P10升至P11(M6)。
同日,小米发布了MiMo-V2.6系列,同时内部晋升名单披露:1995年出生的罗福莉晋升至22级,即小米职级体系的最高层级。她主导的MiMo-V2.6-Pro在Artificial Analysis综合智能指数中获得46分,位列该榜单全球开源权重模型第一。
另一边,1990年出生的周畅从阿里离职后,加入字节跳动,负责Seedream、Seedance和世界模型。
两代人在同一组织架构中交替出现。一边是历经十年、二十年才晋升至一号位的技术老将,一边是将履历压缩至五年甚至十年的90后们。
在“Transformer问世不足十年、ChatGPT爆发不到五年”这一技术周期内,“论资排辈”这个运行数十年的变量,似乎已失去效力。
但90后真正接手的,不仅是职位,还有未解决的技术债务、商业化压力以及追赶风险。交接已经完成,考验才刚刚开始。
01 刘大一恒与陈宇森:一条通向底座,一条通向商业
将刘大一恒和陈宇森放在同一届云栖大会的两天中,恰好能看出两种不同的90后主导大模型的路径。
刘大一恒2012年进入四川大学计算机学院,2015年以综合排名第一保送直博,2020年获得博士学位。
他首次进入公众视野是2019年在ACL发表论文,成为川大在读研究生首次在ACL发表成果。
同年,他参与谷歌Natural Questions全球长期公开竞赛,与谷歌AI和IBM Research等团队竞争,他所在的团队提交时取得世界第一并保持三个月。
2020年,他成为华为“天才少年计划”第一档中西南地区唯一入选者,2021年1月加入阿里达摩院。
2026年3月9日,他负责手Qwen预训练,同时代管后训练和Coding团队,向代管Qwen一号位的阿里云CTO周靖人汇报。这一任命在阿里内部半年前就开始流传,直到9月才对外确认。
他公布的技术路线中,递归式自我改进(RSI)最为激进:让模型从真实任务中发现不足、构造训练数据,再评价和修正结果。
陈宇森走到千问办公负责人位置,路径是先技术,再做产品。
1992年生,本科毕业于浙江大学竺可桢学院求是科学班计算机专业,联合创办企业级网络安全公司长亭科技,2017年入选福布斯中国30岁以下精英榜。2019年长亭科技被阿里云全资收购,他随之进入阿里;后来离开创业,项目停止后重返阿里云。
今年6月11日,陈宇森接任钉钉CEO,成为阿里历史上最年轻的事业部CEO;7月,三条原本分散的Agent产品线整合为“千问办公”事业部,他兼任CEO。
两人都是明星负责人的继任者。刘大一恒接替林俊旸留下的Qwen底座负责人空缺,陈宇森则接过无招(陈航)的接力棒,后者2010年便加入阿里,是钉钉初代掌舵人。
但他们承接的命题截然不同。
刘大一恒要解决的,是基础大模型的能力上限问题。底座研发的核心挑战,是持续压缩模型的能力天花板与成本之间的矛盾。
陈宇森的课题,则落在大模型的商业化落地与整合。把大模型能力嵌入钉钉原有工作流,找到企业客户愿意买单的价值点,完成从技术能力到规模化业务收入的转化。
一个通向底座,一个通向商业。这两条线共同构成了阿里大模型体系的一体两面。
02 三张硬成绩单:开源、多模态与智能体
罗福莉、周畅和姚顺雨,分别站在开源大模型、多模态生成和AI Agent三个方向上。他们的履历证明,在一个技术范式快速变化的行业里,一次足够关键的成果,可能比多年按部就班的晋升更有说服力。
罗福莉的故事,最直接地体现了大模型行业的晋升速度。
2025年11月她正式加盟小米,全面负责MiMo大模型业务。约10个月后,即2026年9月,她晋升至小米22级,也就是小米职级体系的最高点。小米13至22级共10档,副总裁对应21至22级,雷军本人不在这个体系内。
这次晋升并非仅靠传闻和头衔。
毕业后,罗福莉曾进入阿里达摩院,主导多语言预训练模型VECO;2022年进入幻方量化,随后加入DeepSeek担任深度学习研究员,成为MoE大模型DeepSeek-V2的核心开发者之一。
到了小米,她的成绩单更加直接:MiMo-V2-Pro总参数超1万亿,在Artificial Analysis榜单上按品牌排名全球第五,反超xAI的Grok;MiMo-V2.6-Pro获得46分,成为全球开源权重模型第一。
周畅的故事则更像一次跨公司的能力迁移。
2017年7月,他校招进入阿里达摩院,花名“钟煌”。在阿里最初几年,他做的是电商推荐算法,与大模型无关。
后来,他主导了“通义-M6”“通义千问”的模型架构设计。离职前夕发布的Qwen2,两小时就冲上Hugging Face开源榜首,超过Llama 3-70B,也超过当时国内一众闭源模型。
后来,阿里随后以违反竞业协议为由提起劳动争议仲裁,这起纠纷一度让“竞业墙”成为行业公共话题。
2024年下半年,周畅低调加入字节Seed,职级4-2。入职不到一年,他接管Seedream、Seedance和世界模型团队,后来周畅的管理边界进一步延伸至具身智能领域。
真正让他进入公众视野的,是2026年2月的Seedance 2.0。该产品2月7日内测,2月12日正式发布;其间,A股短剧概念股曾在集体涨停。
周畅用一个多模态产品,为字节的追赶叙事打开了突破口。
姚顺雨则是先在学术阶段定义了Agent时代的关键方法,再进入顶级AI公司参与产品落地,最后加入腾讯,同时掌管模型与基础设施。
从普林斯顿毕业后,姚顺雨在2024年加入OpenAI,参与AI Agent和任务执行系统方向开发。2025年12月,腾讯升级大模型研发架构,姚顺雨出任CEO/总裁办公室首席AI科学家,同时兼任AI Infra部和大语言模型部负责人。
AI Infra决定大模型如何训练、如何推理、如何提高效率;大语言模型部决定混元的能力上限和迭代方向。腾讯把这两部分同时交给姚顺雨,意味着他既要负责前沿模型能力,也要负责支撑模型能力的工程底座。
加入腾讯后,姚顺雨用Hy3完成了一场反击。这款总参数只有300B、激活参数21B的中型模型,在多项能力上表现出了优于GLM5.1的表现。
而Hy3上线后,腾讯的WorkBuddy上主动选择Hy3的用户数增长了6倍,日均文字处理量较预览版增长20倍。
罗福莉、周畅和姚顺雨的共同之处在于,他们是在一个新范式里先做出结果,再被组织赋予更大的权限。
03 交棒已完成,大考才开始
“90后接管”在2026年大模型市场被反复提及,但它并不是一个已经完成的结果。
已经完成的是职位交接:刘大一恒管Qwen模型,陈宇森管千问办公,罗福莉管MiMo,周畅管字节多模态,姚顺雨管腾讯大语言模型和AI Infra。
还没有完成的是能力验证。
刘大一恒面对的,是基础模型的能力上限与成本约束。底座研发的难点,不只是把参数继续做大,而是在长文本、推理、代码、智能体能力上持续突破,同时控制预训练和后训练所需的巨大算力与数据成本。
陈宇森面对的,是商业化落地和组织整合。千问办公要把分散的Agent能力、钉钉生态和Qwen底座能力打包成用户可感知的产品。
真正的难点不是演示一个会对话、会调用工具的Agent,而是让它进入会议、文档、审批、协同等真实工作流,解决“演示惊艳、日常难用”的问题,并找到企业客户愿意持续付费的价值点。
罗福莉面对的,是开源成绩能否转化为可持续范式。
她完整展示强化学习训练全过程,并公开成本:MiMo-V2.6-Pro后训练用时6天,使用约75万条真实任务轨迹,总训练成本347万美元,每天约合400万元人民币。
这个数字引发讨论。同济大学电子与信息工程学院副教授李王明卉对媒体表示,关键不是“便宜”,而是它把强化学习后训练变成了一种可计量的服务能力;但这取决于环境搭建、工具执行、结果验证的边际成本能否被摊薄。
如果这些异构环境能够被工程化、标准化、复用化,它可能成为一种新的服务定价范式;否则,347万美元只是一次漂亮的标杆。
周畅和字节面对的,则是追赶者如何补基础能力的课。
Seedance 2.0让周畅负责的多模态业务打出了声量,但这并不意味着追赶已经结束。视频生成之后,还有世界模型、实时交互、成本控制、规模化商用等一系列难题。
姚顺雨面对的,是能力走向组织体系的考验。腾讯并不缺少场景:社交、内容、会议、文档、云、企业服务,但场景本身不会自动变成能力,必须通过工具接入、数据回流、真实评估和基础设施建设,把它们转化为模型可理解、可执行、可迭代的系统。
这正是90后接管的另一面:他们进入的是更快的决策循环、更大的资源盘子,也是更高的风险敞口。职位可以在一次组织调整中完成交接,但能力必须通过一轮又一轮的模型、产品、收入和成本来验证。
本文来自微信公众号“Tech星球”(ID:tech618),作者:任雪芸,36氪经授权发布。