AI 周中热点速览:Qwen3.8 开源在即,Astra 攻克十大数学难题
如果你这周只在地铁上刷了两条推送这篇把 8 月第一周最值得开发者关注的 AI 进展一次讲清。主线很集中大模型竞争的焦点正从单次问答更强快速转向自主执行长周期工作流。本周发生了什么8 月第一周信息密度极高但主线清晰无论是阿里让模型自主跑 16 天交付开源项目、OpenAI 用长链路推理攻克数学难题还是实时语音变成委派面都在指向同一个方向——AI 开始独立交付端到端任务。下面分五条拆解。一、阿里 Qwen3.8-Max 发布并预告下周开源权重8 月 3 日阿里巴巴正式发布新一代旗舰基座大模型Qwen3.8-Max。据官方与多家媒体模型总参数量 2.4 万亿、激活 95B采用稀疏 MoE 与混合注意力联合优化原生支持视觉理解上下文长度达 1M Tokens。最值得开发者关注的是它的自主编程能力官方披露模型从一个空文件夹出发、无人干预运行约 16 天完成自进化智能体框架oh-my-cli并已在 GitHub 完全开源其运行历史。在权威评测中Qwen3.8-Max 的 CodeArena 排名全球第四OSWorld-Verified电脑操作以 86.1 分居主流模型首位PaperBench 达 93.0 分。【配图 01请上传 images/01-01-coding-agent.png 后删除本行】图1Qwen3.8-Max 自主编程 16 天交付开源项目示意图非真实截图更重磅的是开源计划Qwen3.8-Max 预计下周开源权重Qwen-Max 旗舰系列首次开放权重同时开源 Qwen3.8-27B。API 已上线千问 AI 平台国内定价为每百万 Tokens 输入 12 元、输出 36 元缓存命中仅 1.5 元。来源澎湃新闻、网易、国际金融报、新华网财经2026-08-03二、OpenAI 公开 Astra约 2000 美元算力攻克十大数学难题8 月 1 日OpenAI 首次公开下一代模型系列名称Astra拉丁语群星并同步放出 249 页研究手稿、62 页推理说明以及全部转化为 Lean4 形式化证明、上传 GitHub 开源的论证文件——所有证明可被机器自动校验。【配图 02请上传 images/02-02-reasoning.png 后删除本行】图2Astra 长链路数学推理示意图非真实截图据披露Astra 内部版本在高等数学与理论计算机科学取得十项突破覆盖高维球体堆积、康涅斯刚性猜想推翻、算术电路复杂性、格密码等基础方向且每个问题的主要结果至少十年没有进展。按公开 API 费率估算寻找这些解法的 Token 总成本约2000 美元。需冷静看待Astra 尚未开放公开访问成果也还未进入同行评审更像是 OpenAI 在开源逼近、企业市场被蚕食背景下的技术护城河展示而非 GPT-5.6 的继任者。来源界面新闻、腾讯新闻、OpenAI 官方博客2026-08-01 至 08-03三、DeepSeek-V4-Flash 正式 API 上线后训练价值被重估8 月 1 日 DeepSeek-V4-Flash 正式版 API 上线8 月 3 日国家超算互联网同步上线其调用与下载。模型采用 MoE总参数 2840 亿、激活 130 亿支持 100 万 Token 上下文可切换思考 / 非思考模式。真正引发讨论的是模型骨架与预览版完全一致仅重新做了后训练Agent 能力却质的飞跃——用于长周期编程的 DeepSWE 从 7.3 分升至 54.4 分约 6 倍Terminal Bench 2.1 达 82.7 分。这直接抛出一个命题当同一骨架仅靠后训练就能拉开代差堆参数是否还是唯一出路来源TechWeb、界面新闻、国家超算互联网2026-08-01 至 08-03四、OpenAI 放出 GPT-Live 全双工语音的工程细节8 月 3 日OpenAI 发布第三代语音系统GPT-Live工程深潜从轮流对话转向流式全双工模型同时听和说过去决定助手何时开口的 turn detector 被去掉音频作为连续信号直入模型需深度推理时后台无缝交给 GPT-5.5不打断实时对话。工程上推理引擎用 Go 重写原 Python asyncio 管线使帧投递 p95 达到旧方案 p50基于 WebRTC 并引入 WARP 协议把媒体会话启动从 6 次网络往返压到 1 次。对开发者而言实时语音正成为委派面——廉价快模型扛对话昂贵推理走旁路。来源OpenAI 工程博客、dev.to AI Daily Digest2026-08-03五、学术侧受大脑启发的低功耗 AI 模型登上 Nature 子刊7 月 31 日8 月 1 日报道奥地利格拉茨理工大学等受海马体启发开发新型 AI 模型论文发表于《自然·机器智能》。该模型提炼人脑三种核心机制构建认知地图、进行随机神经计算、采用组合编码能耗远低于主流神经网络 / 大模型。研究者强调这套系统并非取代 LLM而是为机器人、自动驾驶等功耗受限的本地场景提供替代方案。来源科技日报2026-08-01本周模型进展速览模型 / 事件关键数据日期Qwen3.8-Max2.4T 总参 / 95B 激活 / 1M 上下文2026-08-03DeepSeek-V4-Flash2840 亿总参 / 130 亿激活 / DeepSWE 7.3→54.42026-08-01OpenAI Astra249 页论文 / 十项数学突破 / ~2000 美元成本2026-08-01GPT-Live全双工 / WARP 6 RTT→12026-08-03小结从答题到干活把五条串起来有三条趋势能力边界从单点辅助迈向长周期自主交付开源权重 极致定价正在压缩闭源溢价后训练与能效 / 安全成为新焦点。对开发者最实用的启发是别只盯榜单分数多看模型能不能替你把一整段工作流跑完。