作者 | 蒋涛来源 | 硅基时间“我成功经历不多太多失败经历。”用这句话开始华为面试的人14岁考入清华计算机少年班后来设计了达芬奇架构主导昇腾910到950的演进。他叫廖恒华为半导体首席科学家。 这位昇腾的奠基人曾经反对做昇腾训练卡。过去八年他几乎不接受采访。7月25日张小珺与他近5小时的访谈完整版上线。我听了不止一遍信息量大到需要不断暂停做笔记后来才知道华为内部也有很多人在反复听。但真正让我停下来的不只是一个顶尖工程师对失败的坦诚而是这场访谈提供了一个理解中国AI竞争力的新入口中国可识别算力约为美国的十分之一为什么头部模型没有差十倍答案不只在芯片里。廖恒博士的履历本身就是半张半导体地图。普林斯顿博士后出站1997 年进入 PMC-Sierra——那是泡沫年代纳斯达克的明星芯片公司他在那里见过巅峰也跌过低谷完整穿越了一个半导体周期。2016 年他加入华为海思。“为 AI 专门做一颗芯片”的提案就是他和何庭波一起摆上华为轮值董事长徐直军桌面的。2019 年 8 月910 发布华为称它是当时全球算力最强的 AI 训练芯片——而就在三个月前这家公司刚被列入美国实体清单。这篇文章整理时我的老朋友、对华为研究最深的方兴东博士的《昇腾崛起》恰好出版——6 年近百位亲历者。访谈里只露了一角的事书里补齐了另一面一场 5 小时的问答一部 10 年的内部史。书里有两个廖恒的故事不讲不行一个是讲制裁。海思的合规部门在被打压之前就对美国出口管制的每一条条款烂熟于心华为在美国的开发团队每个开发动作都主动申请出口许可——哪怕那项技术根本不在管制清单里。守规矩守到这个地步还是被行政手段直接按住自始至终没有一纸法庭指控。廖恒的形容是对一只合规的小羊下狠手真相可能是一头狮子要吃这只小羊。另一个是他的提案。制裁最狠的时候他对何庭波说我们把香农和肖克利工作过的玛丽希尔园区买下来改成博物馆让美国人羞愧一下。提案没有落地。但一个被封锁到墙角的人想的不是报复是给科技史上的圣地立一座馆。被打成这样还敬畏着对方文明里最好的东西。这就是华为的价值观。我在开发者生态里做了二十多年和国内外顶级技术厂商几乎都合作过——见得越多越知道对技术生态做战略级规划的公司有多稀少华为是最让我佩服的那一家。有廖恒这样一大批顶尖人才有把整个公司押上系统战的华为再加上 DeepSeek、Kimi、智谱这批开源模型公司——中国在 AI 大模型上是真有机会领先的。对我们正在做开发者工具的人下一代球 Agent 生态战才刚刚开始。访谈有七个部分从芯片史一路讲到工程师的故事非常值得大家完整听一遍。我从里面挑出三个问题——每一个都比答案更值钱单卡打不过英伟达,怎么办?摩尔定律还算数吗?怎么看 DeepSeek?顺着三问往下走中间摊开一张算力地图走到头再接上我自己补的最后一问卡最多的公司,为什么模型不一定最强?AI 的竞争单位已经换了三次轨先是芯片后是系统现在是 GW(吉瓦)。先把结论的一半放在这里按可识别的芯片保有量口径中国算力约是美国的十分之一但权威榜单上头部模型只差 4 分——差距被“转换率”吃掉了训练一个万亿参数模型折算下来只要几千张卡跑一个月——主训练的门槛是千卡月级不是百万卡级卡最多的公司模型不一定最强——拥有算力、可集中算力、转换率是三件事但效率救不了终局竞争单位正在从“卡”换轨到“GW”为什么正文见至于中国的打法——三步解法、三道坎、七场必须打赢的仗在下篇 另一半结论藏在廖恒的十八层宝塔里。01 第一问单卡打不过英伟达怎么办?过去两年,国内讨论国产 AI 芯片,总绕不开这个问题。它也是整场访谈绕不开的第一问。廖恒的回答,是反对这个问题本身。他的原话概括起来是:华为的突破口在跨层协同——用系统集群的优势,弥补单芯片的硬件短板。单卡比不过,就在系统层赢回来。《昇腾崛起》记录了制裁后华为内部的原话——图灵业务负责人雷景宸:“我们要用系统而不是单颗芯片去打”昇腾计算负责人张迪煊“以面积换算力以工程补工艺”。系统战是写进作战方针的路线。这和英伟达的路径其实是同一条。很多人以为英伟达赢在 CUDA其实 CUDA 只是最表面的一层。CUDA 下面是 NVLinkNVLink 下面是 NVSwitch再往下是 InfiniBand 网络最后是整座 AI Factory。买一张 H100你以为买的是芯片——你买的是一整套别人花二十年搭好的系统。我在《我每天都在用 Claude却不会买 Anthropic》里用过一个比方模型是发动机调度和基础设施才是整车。廖恒讲的是同一件事的硬件版芯片是发动机系统才是整车。02 第二问:摩尔定律还算数吗?访谈的第二问问的是制程。很多人觉得 7nm、5nm、3nm 就是全部。廖恒的判断是摩尔定律真正停下来的是经济性——在 16nm 甚至 7nm 阶段每晶体管的成本就不再下降了。性能还在走账算不过来了。我把他的判断概括成一句摩尔定律没有死它只是把接力棒交给了系统。这不只是访谈里的一个观点。今年 5 月何庭波在 IEEE ISCAS 上发布了华为的“韬(τ)定律”几何上做不小就在时间上做快——用“逻辑折叠”压缩信号时延换等效的晶体管密度目标是 2031 年做到 1.4 纳米制程的同等水平。背后是华为海思六年 381 款芯片的实践。廖恒说接力棒交给了系统韬定律是华为把这套内部实践总结成的自家定律——行业还没投票但 381 款芯片是它的实证。顺着这个判断他给出了整场访谈最大的原创十八层宝塔。半导体不是一个行业是一座塔。从矿石到应用十八层层层相扣——每一层的名字都在图里。这座塔推出的结论只有一句产业链的整体上限由最短的那一层决定。这句话的分量要对着过去十年看才看得清。中国讨论半导体一直是横着看的EDA 国产替代、设备国产替代、GPU 国产替代——一个个孤立的战场。廖恒第一次把它竖起来任何一层塌了整座塔封顶的高度就被锁死。竖着看还带出一个人才判断。他说每一层的专家中国都不缺缺的是能纵向贯通十几层的人。他甚至坦言自己接受采访的动机之一是焦虑现在很难吸引学生对处理器硬件产生兴趣了。未来最贵的工程师不是 GPU 工程师也不是大模型工程师。而是能把这座塔上下打通的人。我给这种人起了个名字爬塔人。十八层宝塔之下还有能源、资本、国家能力三层。来源硅基时间制图框架引自廖恒访谈03 把地图摊开:卡,到底在谁手里廖恒讲的是塔。但塔要用卡砌。在接他的第三问之前先把地图摊开——这一节全是数字但每个数字都在说同一件事。先看两把尺一把量公开 AI 超算的性能一把量芯片保有量。两把尺的读数都在图里指向同一个结论。但第二把尺量的是所有权不是使用权——OpenAI、Anthropic 的训练算力大多租自云厂。谷歌 545 万张居首中国全部公司合计 115 万张约等于 Oracle 一家。来源Epoch AI 口径拆解(2026Q1 估算)中国所有公司算力加起来大约等于 Oracle 一家拥有量。不到谷歌的四分之一——粗算中国的总算力约是美国的十分之一只比头部实验室可集中的训练算力还会更低。这是可公开识别口径的估算适合看结构不适合当资产盘点。而且快照会过时xAI 的 Colossus 2 单个园区一年翻倍、已逼近百万张当量、耗电接近 1GW。按 Epoch 口径的一份拆解中国 AI 芯片总量约 322 万颗颗数和美国主要算力所有者只差 4.8 倍可折成 H100 当量(把不同芯片按峰值性能折成 H100 的张数)只剩约 115 万张差距被拉到 14 倍。从 5 倍到 14 倍之间的那一段全是塔腰——单颗芯片的制程、HBM(紧贴芯片的高带宽内存)、互联。中国缺的不只是芯片颗数是每一颗的当量。DeepSeek 说自己手里的算力约是美国头部实验室的二十分之一放在这张图里一点都不夸张。卡的分布比模型的排名诚实。钱的分布同样诚实。美国四巨头的数字在图里每家都在加磅投入谷歌本季度刚上调全年资本投入到 2000 亿美元自由现金流首次为负。中国这边也在猛踩油门字节上调到超 2000 亿元人民币阿里三年 3800 亿的盘子吴泳铭说实际会超还留了一句很实在的话“现在阿里的服务器内几乎没有一张卡是空的。”本篇定稿这一周腾讯交出单季 528 亿元的资本开支——超过阿里上季度的 387 亿居中国上市科技公司之首也把自由现金流干成了上市二十多年来的第一次负数。中国最谨慎、最会赚钱的互联网巨头也开始用负现金流抢算力了。两边投入口径各有出入但量级清楚钱差一个数量级卡差一个数量级。模型那头差距是多少Artificial Analysis 八月的榜给了答案分数都在图里。最扎眼的是另一个数字中国前五的模型四个开放权重美国前五零个。算力差 14 倍头部模型差 4 分。算力差 14 倍头部模型 61:57 只差 4 分——差距被转换率吃掉。来源Epoch AI · Artificial Analysis(2026.08)模型能力对算力从来不是线性的——61 分也不是比 57 分“强 7%”榜单打分本身还会压缩头部之间的差距。这道方程的价值不在比例在方向算力的差距没有按任何合理的换算关系传导到模型上。中间一定有东西在起作用。它是什么这正是廖恒第三问的入口。04 第三问:怎么看 DeepSeek?访谈里我最关注的是廖恒评价 DeepSeek 的创始人。他说这位创始人主动选择了难度更高的稀疏激活架构(MoE)这不是算法优化是贯穿软硬件的顶层战略选择。原话是:「他已经先知先觉地提前去解决一个他预期到的问题。这就是先验者的价值。」一家以硬件立身的公司把最高的评价给了一家模型公司的架构决策——这句话本身就是“系统战”最好的注脚最好的算法设计是替算力短缺提前做的设计。先验者到底“先验”在哪算一笔账就清楚了。以 Kimi 的 K2 为例——万亿参数俱乐部里少数把训练细节公开的模型总参数 1 万亿每个 token 只激活 320 亿。这笔账的每一步都在图里落点是——四五千张卡跑一个月。(主训练账不含试错与后训练——研发总账大得多但量级不变。)万亿参数听起来是天文数字算下来是几千张卡一个月。这就是 MoE 这个“先验”的全部意义总参数决定模型的容量激活参数才决定算力账单。一万亿的身体只用三百二十亿在思考。15.5 万亿 token、3×10²⁴ FLOPs折算约四五千张卡跑一个月——与巨头数百万张的保有盘相比只是零头(跨口径量级示意)。来源Kimi K2 技术报告折算所以中国公司握着全球 15% 的卡做得出第一梯队的模型——因为一次主训练的门槛是千卡月级不是百万卡级——研发总账远不止这一笔但入场券确实没有想象中贵。DeepSeek 的二十分之一、Kimi 的几千张卡够用了。把 Kimi 和智谱的技术报告摊开能数出五个关键动作——每一个都替算力短缺做架构设计一稀疏化只为用到的参数付钱。K2 是 1T 总参、32B 激活GLM-5 是 744B 总参、40B 激活——万亿的容量几百亿的账单。二优化器:同一批数据榨得更透。Kimi 把 Muon 改造成 MuonClip15.5 万亿 token 预训练全程零 loss spike(损失突然跳升、严重时要重训的事故)——万亿规模的训练一次点火成功不炸炉就不用重训重训一次就是几千卡月翻倍。三注意力把长上下文的账单打下来。GLM-5 用稀疏注意力(DSA)把长序列计算省 1.5 到 2 倍且只用 200 亿 token 就完成改装——同类做法此前要近万亿 token。四后训练让 RL 的卡不空转。智谱开源异步 RL 框架 slime生成与训练解耦Kimi 用 Agent 数据合成替代昂贵的真实交互。五推理训练时就替部署省钱。两家都用 INT4(4 位低精度)量化感知训练低精度在训练里就练进去GLM-5 还原生适配昇腾、摩尔线程、海光、寒武纪等国产芯片——软件栈直接长在塔腰的国产层上。结果是按 GLM-5 技术报告的基准平均它对标 Claude Opus 4.5 与 GPT-5.2、优于 Gemini 3 Pro在 LMArena 上是排名最高的开源模型也是第一个在 Artificial Analysis 智能指数拿到 50 分的开源权重。而智谱2025 年初就被列入了美国实体清单。被禁运的公司训出了逼近闭源第一梯队的模型。美国的模型在花算力中国的模型在省算力——省下来的部分就叫转换率。算力充裕的人可以靠穷举试错算力短缺的人必须提前判断。每一次实验都昂贵每一次判断都必须命中。算力充裕的人做加法算力短缺的人做判断。05 最后一问卡最多的为什么模型不一定最强?把巨头卡数那张图和模型排行榜放在一起看会发现一个错位谷歌五百多万张Gemini 强但没有强出五百万张的样子。微软三百五十多万张自研模型至今没进第一梯队。亚马逊二百五十万张同样如此。马斯克的 xAI 建起了全球最大的单体集群Grok 挤进了第一梯队但没有像它的算力份额那样一骑绝尘。Meta 二百四十万张Llama 4 口碑不及预期整个 AI 部门随后重组。 卡最多的模型不一定最强。这是什么道理?拆开看是两层。第一层拥有算力 ≠ 可集中算力。云厂的卡大部分不是自己用的。谷歌五百多万张大头撑着搜索、广告、YouTube 的推理匀一块租给客户微软三百五十多万张大部分挂在 Azure 上替别人干活——包括替 OpenAI亚马逊二百五十万张干脆就是 AWS 的营业资产。真正能抽出来、专门供一场三个月训练的只是零头。云厂的卡在替客户打工实验室的卡在替未来打工。马斯克把五十多万张卡拢在同一个集群里——论“可集中算力”他反而是最富的那一个。富到什么程度今年 5 月他把22万张卡集群 Colossus 1 整体租给了 Anthropic月租 12.5 亿美元一签三年。最缺卡的前沿实验室宁愿给对手交房租也要拿到能整块用的算力——“可集中算力”值多少钱这是市场开出的第一张价目表。这笔交易还有一层潜台词。马斯克肯把 22 万张卡拿去收租等于最前沿的玩家亲手承认继续堆卡Scaling Law 边际回报已经跑不赢房租——算力翻倍模型能力不会翻倍。下一个稀缺的是高质量数据特别是能教会模型独立完成长任务的长程数据是把算力押对地方的判断。第二层可集中算力 ≠ 转换率。但卡集中了也只是拿到入场券。算力要变成模型强度还得过几道关数据配方、RL 工程、评测体系。最难的一道是廖恒说的跨层判断——这么贵的算力押哪个架构押哪份数据押哪次实验DeepSeek 押中 MoE这是判断写成公式:模型强度 可集中算力 × 转换率(数据 × 判断 × 系统工程)转换率放大的是有效算力而模型能力对有效算力还有边际递减。它的用处只有一个指出乘数里哪一项最难得。算力是乘数里最容易买到的那一项所以它最先内卷也最先失去区分度。真正拉开差距的是转换率——它买不到只能长出来。拥有算力是资产负债表转换率才是战斗力。算力不是一个数字是一组配比。预训练吃计算和互联Prefill(模型读入整段上下文)吃计算和内存带宽Decode(逐字往外生成)被内存容量和带宽卡死——所谓“H100 当量”只是把不同的芯片压进一把便于比较的尺子落到真实任务里同一张当量卡能释放多少能力取决于它被放进什么系统、跑什么负载。中国缺的不只是卡还有和任务匹配的内存、互联和软件效率。而配比之外还有两样东西卡再多也换不来。一是数据卡决定你算得多快数据决定你学到什么。Grok 守着 X 的实时信息流Gemini 守着 YouTube都没有自动换来第一——数据的要害不在多在质量、在配方最贵的那种就是上面说的长程数据。二是人才Meta 这一年用上亿美元的薪酬包把顶尖研究员成建制地挖进新实验室人才密度一夜拉满模型能不能翻身行业都在等答案。《昇腾崛起》里记了廖恒的金字塔之问十万个莫扎特也建不成金字塔。但要害不在“AI 公司管理更强”——巨头的组织是为搜索、广告、云长出来的层层审批、处处协调AI 原生公司是新方法论长出的新形态百人上下研究员直接支配算力想法到实验之间没有中间层。买来十一个巨星买不来一支球队挖得来人才挖不来成功组织的形态。配比要配得对、路线要押得中(第三问已经讲过这种先验)最后都要靠组织把它变成系统。芯片、编译器、框架、数据、训练、运维任何一层脱节理论推算的算力都在漏。所以转换率的完整写法是转换率 架构判断 × 数据效率 × 系统工程 × 组织协同这里必须接住一个反问这些省算力的技术美国人不会用吗?会而且有些早就在用。MoE 的源头本来就是谷歌Gemini 从 1.5 起就是 MoEOpenAI 放出的 gpt-oss117B 总参、5.1B 激活、原生 4bit——同一套牌人人都在打。中国公司的论文和权重全部公开闭源实验室可以无声吸收反向却看不见开源是一面单向镜。但闭源公司吸收有三道摩擦不敢改用不上慢半拍。不敢改10 万卡的集群上换一个新优化器失败一次烧掉的钱远超省下的钱算力越充裕的人越保守富人不轻易改菜谱穷人每顿都在改。用不上MLA、DSA 里有一部分设计和受限芯片的互联、显存深度耦合搬上 NVLink 满配的集群收益就缩水为镣铐设计的舞步脱了镣铐价值打折。慢半拍论文是公开的闭源却不敢直接抄要先在自家的数据和集群上小规模复现、逐级放大验证而旗舰训练一年就开那么一两班车验完车往往已经走了。一来一回就是半年。更要紧的是算总账效率是乘数不是差值。同样的技术乘在百倍的基数上就是百倍的绝对产出——把云厂可集中的折扣打完量级仍然碾压。省算力的技术抬高所有人锁不住差距——真正锁得住的只有两样持续产出这类技术的组织能力和塔基的电。既然几千张卡就能训万亿模型效率技术又终将人人都有美国人为什么还在疯抢着建一座接一座GW级的数据中心。因为训练只是账单的开头。模型强不强看转换率模型能服务多少人、多少 Agent 并行地跑看的是推理算力的总盘子——那才是吃电的大头。竞争单位就是在这里从“卡”换轨到“GW”的。效率提升不会减少消耗只会放大总需求。瓦特把蒸汽机的效率翻了倍英国的煤没有省下来烧得更凶了。MoE、量化、稀疏注意力同理一次调用越便宜调用的人越多并行的 Agent 越多过去不值得自动化的任务统统变得值得。效率不是 GW 的替代品是 GW 需求的放大器。黄仁勋在 GTC 2026 上把英伟达重新定义为 token 工厂的供应商数据中心不再是存文件的仓库是生产 token 的工厂固定功率之下每瓦 token 吞吐最高的成本最低。他给最新的 Rubin 平台定的目标就是综合性能下最佳的 token 生产机器——两年里单机架的 token 产出提升了几百倍。英伟达自己都不再讲卡的故事了讲的是每瓦的 token。06 宝塔往下,还有三层我反复听了几遍访谈觉得最值得接着往下想的是塔基。 廖恒的十八层最底层是矿石和材料。但站在 2026 年的算力地图前矿石下面至少还有三层。第十九层能源。xAI 的 Colossus20 万颗芯片耗电约 300MW。Meta 在路易斯安那建的 Hyperion规划 5GW投资超过 500 亿美元当地电力公司要为它配套新建燃气电站。照 Epoch AI 的外推2030 年的领先 AI 超算可能需要 9GW——喂给一台机器。微软买下三哩岛核电站重启后的长期电力谷歌预订了还没造出来的小型核反应堆——巨头们抢电抢到了十年后。AI 终局是电力竞争已是人人都会说的共识。但真正的要害是速度差芯片按年供给资本随时可融模型一夜开源——只有电按五年供给一座 GW 级电站从审批、输电到并网五年起步。竞争换轨到 GW本质是换轨到最慢的那条供给线。GPU 是种子电才是土地。种子可以进口土地搬不走。第二十层资本。一年 7250 亿美元——阿波罗登月计划 13 年的花费折算到今天约 2600 亿美元。四家公司一年花掉将近三个阿波罗。这考验的不是谁出得起钱是谁的资本市场能连续十年消化这种烧法。这已经不是公司的财务问题是一个国家金融体系的耐力问题。第二十一层国家能力。美国的领先,拆开看不是英伟达一家的领先。是英伟达台积电供应链五朵云核电审批债券市场全球人才同时在一个体系里运转。塔的每一层背后,都站着一套国家机器。所以“追赶英伟达”是个伪命题——要追的从来不是一家公司是它身后这套同时运转的机器。单集群功耗五年内从 300MW 走向 9GW——约为三峡装机的四成。来源公开报道·Epoch AI 外推把塔画完整结论自然浮现 过去塔的底层是硅。 未来塔的底层是电。07 终局:美国的芯片在等电,中国的电在等芯片把中美两边放进同一座塔里看格局是错位的层美国中国塔尖(模型/应用)领先约半年到两年快速跟进开源反超塔腰(制程/HBM/单芯片)强最短的层塔基(电力/电网)最紧的约束强中国 2024 年发电量约 10 万亿千瓦时大约是美国的两倍特高压电网能把西部的电成规模地送进算力园区。美国的芯片在等电中国的电在等芯片。美国的短板在塔基中国的短板在塔腰。这场竞争两边拿的是互补的残局。马斯克 7 月在《经济学人》的访谈里给出了同一个框架中国之外电力是关键约束中国之内芯片是约束。更早他年初在播客里就预测过中国将在 AI 算力上远超世界其他地区——理由正是电。终局怎么破——中国的三步解法、三道坎以及七场必须打赢的仗统一软件栈、超节点、自研 HBM、模型-芯片联合设计、调度、推理、端侧。每一场都有名字、有对手、有账每一场都够单独一篇。我还会继续写下篇《七场仗:中国算力的作战地图》一场一场拆。────────────────────写到这里可以把全文的三条线收拢了。廖恒回答了芯片DeepSeek 回答了模型7250 亿美元回答了钱——三个答案指向同一个方向这场竞争已经不是公司与公司的竞争是国与国、塔与塔的竞争。而塔的最底层是电。未来的竞争不是人与人而是时间与时间的竞争。而硅基时间是用电造出来的。────────────────────作者手记 //这篇文章里藏着两个方向相反的事实一边是 GW 决定论——电才是终极瓶颈另一边是 K2 的那笔账——几千张卡就能训出万亿模型判断能部分替代瓦特。判断到底能替代多少瓦特这个替代率才是中国真正的胜负变量。廖恒说他受访是因为焦虑很难再吸引学生对处理器硬件产生兴趣了。行业最强的人担心的不是对手是没有人爬塔。这件事不能只记下来。做了这么多年开发者社区能做的一件事是把爬塔人的故事讲出来——让年轻工程师看见塔的中下层走得通也值得走。这篇算第一步。访谈里还有一个预言值得记下廖恒判断Physical AI(物理 AI)还没完成从零到一的突破真正的爆发可能还要两三年。这个判断先存档到时候回来对答案。下篇《七场仗中国算力的作战地图》已经在打磨几天后见。◇ ◆ ◇主要资料来源张小珺对廖恒访谈完整版(2026.07.25)· 方兴东《昇腾崛起》(湛庐文化,2026.08)· 华为韬(τ)定律(2026.05,IEEE ISCAS)· 黄仁勋 GTC 2026 演讲(2026.03)· Epoch AI(超算追踪 / Chip Owners Explorer)· Artificial Analysis 智能指数(2026.08)· Kimi K2 / 智谱 GLM-5 技术报告 · 腾讯 2026Q2 财报(2026.08.12)· 各公司财报电话会与公开披露。数字均为公开口径估算适合看结构不构成资产盘点。2026 奇点智能大会11 月 20-21 日·北京。奇点智能研究院联合 CSDN把两场技术大会放在了同一个时空里奇点智能技术大会始于 2016——大模型演进、AI Native 研发、企业级 AI 落地、多模态与世界模型、具身智能C 及系统软件技术大会始于 2005——现代 C 演进、AI 算力与推理优化、高性能低时延系统。为什么要放在一起因为上层 AI 应用的爆发离不开底层系统软件的支撑而底层技术的演进方向也正在被 AI 重新定义。70 位技术专家18 个前沿专题1000 同行到场。如果你也在这些方向上做研究、做产品、做工程别错过。首位确认重磅嘉宾OpenAI 资深研究科学家 Łukasz Kaiser。Transformer 八子中唯一还在科研前线的人GPT-4/5、o1、o3、ChatGPT 的核心共同发明人。2021 年他在这个大会上给出三个方向多模态、更大更好的 Transformer、模型即服务。五年后全部命中。去年他讲的是推理模型的进化——从记忆到策略再到研究器模型开始学会自己思考。第三次登台他会带来什么扫码领取 Łukasz Kaiser 历年在奇点智能大会的分享 PPT 与视频同步获取大会最新议程与早鸟名额。