Grok 4.6追平ChatGPT-5.6 Sol,腾讯混元与Workbuddy也逆袭,Co-design Loop成加速器!
1. Grok 4.6惊艳登场在成立三年、烧钱无数之后Grok终于活成马斯克想要的样子。昨天凌晨SpaceXAI发布Grok 4.6。Artificial Analysis的独立评测显示Grok 4.6的智能指数61分已经追平ChatGPT - 5.6 Sol紧跟Fable 5 Max的62分且每任务成本0.84美元比起Sol约1.23美元和Opus 5约2.34美元成本优势明显。马斯克显然很兴奋两小时里转了十几条推文最后放话说综合考虑智能、速度和成本Grok 4.6客观上是第一名而且Grok 4.7将会超越当前所有模型。2. Grok的逆袭之路很难想象就在5个月前Grok差点就要吃散伙饭了。今年3月是马斯克的AI至暗时刻当时Grok 4.3远远落后硅谷御三家更麻烦的是xAI的11位联合创始人除了老马本人其他10人全部离职马斯克公开承认“xAI的第一次构建失败了我们必须重新来过”。随后Grok被并入即将IPO的SpaceX中变成SpaceXAI。然而仅仅五个月御三家中的谷歌陷入了模型掉队和人事震荡的泥淖中Gemini被戏称为美国“豆包”Grok却像SpaceX的猎鹰火箭般一飞冲天。治好马斯克AI内耗的是他花了600亿美元收购的Cursor一个AI代码编辑器。3月12日就在xAI创始团队清零的同一天两位Cursor的高级产品工程负责人Andrew Milich和Jason Ginsberg宣布加入xAI直接向马斯克汇报。4月SpaceX和Cursor签署算力与联合开发协议。6月16日在刚完成有史以来最大规模IPO的四天后SpaceX宣布行使收购Cursor母公司的选择权同时还宣布过去几个月SpaceXAI一直在和Cursor联合训练一个模型。Grok逆袭的脚本就是这个“联合训练”写下的。SpaceX在上市前向美国证券交易委员会SEC提交的文件里详细说明了背后的逻辑软件开发是AI非常重要的应用场景因为它同时具备高质量结构化数据、快速反馈周期和高频使用AI编程产生的工作轨迹又能反过来改善模型训练和性能。这是一条清晰的正反馈回路。用户拿Grok干活Cursor记录它怎么干、哪里失败、哪里需要补救工程师把这些真实任务的行为轨迹和反馈结果加工成大模型的训练和评测数据经过RL和持续训练让模型变强。效果来得非常快。7月Grok 4.5发布编程能力直接追平GPT - 5.5且价格只有一半。一个月后Grok 4.6又闪亮登场了。3. 相似逆袭案例这个逆袭配方Anthropic已经验证过了。2025年2月就在deepseek横空出世震惊硅谷的时候当时还是小角色的Claude发布了新模型sonnet3.7跟着模型同时发布的还有claude code一个AI编程助手从此开始了一路开挂不到一年就反超了ChatGPT。有意思的是在Grok逆袭的同一时间也有人用相似的方式实现了相似的逆袭这就是腾讯的workbuddy和混元。4. 腾讯的Co - design Loop在Grok 4.6发布前几个小时腾讯的财报电话会上就重点讲了workbuddy和混元的Co - design协同设计。跟马斯克花大价钱收购业务成熟的cursor不同WorkBuddy是腾讯内部一个小团队趁着3月的“龙虾热”在原来的AI编程智能体codebuddy上改造出来的AI办公智能体。Workbuddy飞速崛起6月的月度访问量已经达到2097万在国内桌面AI办公智能体中排名第一超过第二、第三名之和。更重要的是这样的办公AI是比编程更大的场景和任务富矿每天能产生大量真实工作任务如写PPT、整理文档、处理表格、搜索资料、跑代码、修改文件、调用工具。在这里用户的一次失败任务往往比Benchmark里一个错误更有价值因为它告诉模型到底为什么失败一次成功任务也可以拆成一条可复用的Agent轨迹。这让模型训练得到一种非常稀缺的东西就是真实世界的任务分布、操作轨迹、失败案例和最终结果。负责重建腾讯混元的姚顺雨自然知道这些场景的价值。一年多前他在文章《AI下半场》里就提过大模型的强化学习RL有了泛化能力之后模型评估比模型训练更重要而做好模型评估需要开发面向现实世界效用的全新评估设定或任务。CodeBuddy、WorkBuddy等场景就有大量的面向现实世界的任务和评估所以刚开始重建混元的时候姚顺雨就提出了Co - design的方法让模型跟产品进行深度协同优化。财报电话会上刘炽平肯定了这种效果“通过持续把真实产品使用和领域反馈注入模型训练我们的‘模型 - 产品Co - design’方法让混元得以验证模型精度、识别并解决边缘场景实现更快的模型迭代。”这是混元今年快速进步的一大原因。4月底Hy3 Preview亮相7月正式版发布在Agent、推理和编码等任务上已经进入国产模型第一梯队用295B的小参数实现了性能对标大参数的竞品。混元的进步刘炽平的表述是“能力提升最明显之处体现在其智能体能力和产品体验上在推理、智能体和长上下文任务上的性能跃升为编程、办公、财务建模和前端设计等用例带来了明确优势。”这些能力对应的正是典型的workbuddy用户场景这说明了workbuddy和混元之间开始形成了一个Co - design Loop协同飞轮模型越强用户敢交给它的任务越难。任务越难产生的数据越有价值。数据越有价值下一轮模型就越强。刘炽平在电话会上明确说Hy4将是更大规模的模型目标是逐步逼近行业最先进水平SOTA这可能是向来低调的腾讯高管首次公开喊出“追求SOTA大模型”。几个小时后刚发布Grok4.6的马斯克更是直接立下了SOTA的flag认为SpaceX的训练语料库如此出色且独特如果有任何模型在现实世界工程方面比Grok4.7更好他会感到震惊。马斯克向来欣赏微信在买下推特之后他心心念念的就是把要推特改造成微信这样的万能应用去年年底接受采访时更是直接把X的定位说成了“WeChat”。这回在AI上他又跟腾讯踏进了同一条河流。5. Co - design Loop的价值与影响这种Co - design Loop的出现确实让大模型后发者看到了赶超的希望。Meta最近就推出首款编程AgentMuse Codem搭载了新一代模型Muse Spark 1.2这个模型的定价策略很特别分成了标准版和贡献者版这个贡献者版比标准版的价格便宜了95%开通的条件就一个允许Meta用开发者的编程数据去训练未来的模型。小扎虽迟但到小心思也肉眼可见。但跟硅谷不计成本的大模型竞赛相比国内的AI行业更看重投入与产出所以Codesign Loop更大的价值在于这可能是AI大模型第一次出现类似互联网平台的网络效应用户增长带来数据数据带来模型能力模型能力带来更强产品更强产品带来用户增长。而且在编程、办公等生产力场景用AI来帮自己完成工作任务无论是普通用户还是企业付费意愿都更高。也因此在workbuddy率先跑出来后国内巨头纷纷跟进发力AI办公字节把飞书并入“豆包”阿里整合了“千问”办公大家都把文档、邮件、会议等办公能力接入到agent里既希望制造更多高质量的“真实任务—执行—验证—反馈—训练”循环来提升模型能力也希望在生产力场景中实现AI的商业回报。这种回报已经初现端倪。腾讯财报会上对workbuddy有个表述说明了这一点“目前现金收款正在大幅爬坡年内会逐步转化为腾讯云的报表收入。”更有意思的是腾讯首席战略官詹姆斯的说法他说在所有算力变现渠道里“WorkBuddy产生的Token计费业务能创造最持久的经济回报。”所以虽然腾讯在今年Q2的资本开支达到了527.8亿元同比增长176%首次出现季度自由现金流转负管理层却没有选择把算力直接转手出售按当下行情这能直接赚超过30%但刘炽平说腾讯在“执行一套更长远的战略”会优先把算力给到混元模型和workbuddy等AI应用。能让人放弃唾手可得的30%利润去押注的东西肯定不只是单个的模型或产品的提升而是一套系统一套开始得到验证的复利系统。大模型军备竞赛打了两年多大家终于发现光有大力未必能出奇迹能产生Co - design Loop的产品可能才是技术进步与商业回报的真正加速器。