Deepgram 推出 Flux TTS 支持跨轮次上下文与打断;Anthropic 计划 60 亿美元收购实时生成 AI 公司 Decart AI丨日报
本期编辑三水、鲍勃01 有话题的技术1、Lychee-FD 开源原生端到端全双工语音模型多流 vLLM 推理加速 2.96×长对话显存增量降低约 23%哈工大深圳等团队开源 Lychee-FD一种面向实时语音交互的原生端到端全双工语音语言模型并入选 ACL 2026 Outstanding Paper。模型不依赖级联的 ASR、LLM、TTS 和 Turn-Taking 模块而是在统一多流架构中同时建模持续聆听、语义理解、语音生成和交互控制。采用分层声学-语义建模底层共享参数学习连续音频中的通用语音语言表示上层拆分为 semantic、acoustic 和 dialogue-control 三条流分别负责语义推理、语音 Token 生成以及何时说话、停止、聆听和响应打断。原生处理全双工交互与打断Dialogue-control head 使用 early-exit 路径可在完整语音生成结束前输出 interruption、stop-speaking 和 listen/respond 等控制决策。定制多流 vLLM 在线推理在共享 Backbone 计算后将中间状态分别送入语义、声学和对话控制通道并维护多流解码所需的生成状态与 KV Cache避免所有通道经过单一串行推理路径。Speaking rounds 推理加速约 2.96×团队在线评测显示优化后的多流 vLLM serving pipeline 在模型发言阶段实现约 2.96× 加速并在长 Session 中将增量 GPU 显存增长降低约 23%。代码、模型权重和实时 Web Demo 已开放仓库提供在线 serving、浏览器实时语音前端、训练脚本及 DeepSpeed 示例模型权重已发布至 Hugging Face项目采用 Apache-2.0 License。https://github.com/HITsz-TMG/Lychee-FD( Lychee-FD)2、Deepgram 推出 Flux TTS跨轮次保留对话上下文原生支持打断与流式 LLM 输入Deepgram 推出面向 Voice Agent 的 Flux TTS采用 streaming-first 设计不再将每段文本作为独立 TTS 请求处理而是在多个轮次之间持续保留对话状态根据上下文调整语速、重音和情绪表达。跨轮次保留对话上下文Flux TTS 会读取完整对话而非只处理当前一句并持续保存对话状态使声音、语气和表达方式可以结合此前的交互进行调整无需额外添加 SSML。原生处理用户打断WebSocket API 将每次 Agent 回复作为独立轮次管理发生 Barge-in 后Interrupt会返回用户实际已经听到的text_spoken和尚未播放的内容方便 Agent 同步自身对话状态。LLM Token 可直接流入 TTS实时模式使用wss://api.deepgram.com/v2/speak开发者可持续输入 LLM 生成的 Token由服务端自动决定 flush 边界无需在客户端手动进行文本分块。支持流式与 Batch 两种调用方式/v2/speak同时提供 WebSocket 实时生成和 REST Batch API流式模式面向实时 Voice AgentBatch 模式则用于 IVR、通知和预生成音频等场景。官方盲测自然度 Win Rate 为 73.4%Deepgram 在约 14,400 次双盲成对比较中测试 12 个模型、约 73 个声音和 100 组真实场景脚本Flux TTS 最佳声音的自然度 Win Rate 为 73.4%表达力 Win Rate 为 77.5%该数据为 Deepgram 官方评测。目前首批 Flux TTS Voice 为英语声音支持 Cloud、VPC 和 On-prem 部署。https://deepgram.com/product/text-to-speech/flux(DeepgramAI)3、NVIDIA 发布 Nemotron 3.5 Lightning30B MoE 仅激活 3B 参数同级模型输出速度最高提升 4×NVIDIA 发布 Nemotron 3.5 Lightning一款面向长时间运行 Agent 高频执行任务的开放 MoE 模型总参数量 30B、每 Token 激活 3B 参数。模型针对工具调用、结果验证和子智能体委派等执行型任务优化并通过 speculative decoding、Harness-oriented training 和量化降低连续 Agent 工作负载的推理开销。30B 总参数、3B 激活参数MoE Router 每次仅调用部分专家使模型以较低计算量处理高频 Agent 请求可部署在 DGX Spark 等本地设备或数据中心。同规模模型输出速度最高提升 4×NVIDIA 称 Nemotron 3.5 Lightning 在 Artificial Analysis Intelligence Index 的准确率与输出速度测试中处于 Pareto Frontier面向高调用量任务提高 Token 生成效率。PinchBench 准确率达到 86%在完成 10,000 个任务的测试中Nemotron 3.5 Lightning 在相近准确率下比 Qwen3.6 35B 快 30%。训练阶段直接加入 Multi-Token Prediction模型通过专门的预训练和后续 MTP boosting 阶段提升 speculative decoding 能力同时提供 DSpark 和 DFlash 两种 Draft Model以适配不同并发和部署场景。同时提供 NVFP4 与 BF16 checkpointNVFP4 版本使用 NVIDIA 针对 Blackwell、Hopper 和 Ampere GPU 的量化 Kernel模型还支持 vLLM、SGLang、TensorRT-LLM、llama.cpp、Ollama 和 LM Studio 等推理工具。https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/( NVIDA)4、DuplexWorld 提出一套面向真实日常任务的全双工 Voice Agent 评测框架不再只测试 Turn-Taking、语音自然度或工具调用等单项能力DuplexWorld 提出一套面向真实日常任务的全双工 Voice Agent 评测框架同时评估「任务有没有完成、对话是否自然、声音表现如何」。Benchmark 覆盖银行、保险、旅行、医疗、物流和 Pathfinding 6 个世界、11 类对话、156 个场景累计生成超过 350 小时对话。统一评估 3 类能力、12 个指标指标分为 Agentic Capability、Conversational Dynamics 和 Naturalness 三组包括 Pass1、Goal State、Turn-Taking、Conversation Progression、Selectivity、Faithfulness、DNSMOS、UTMOS、NISQA 等官方明确不将它们合并成一个总分。任务不只停留在数据库操作五个企业场景要求 Agent 通过语音与工具完成真实状态变更Pathfinding 则让 Voice Agent 仅通过语音指导用户在 8×8 虚拟城市中移动环境会随时间变化Agent 需要持续维护对用户位置和朝向的判断。共测试 5 个实时 S2S 模型包括 Amazon Nova 2 Sonic、Gemini-3.1-Flash-Live、GPT-Realtime-2.1、GPT-Realtime-2.1-mini 和 Grok Voice Think Fast 1.0总计完成 3,825 段计分对话。最佳综合任务 Pass1 仍只有 0.490六个世界平均结果中Grok Voice Think Fast 1.0 的 Pass1 为 0.490GPT-Realtime-2.1 为 0.433Gemini-3.1-Flash-Live 为 0.398重复执行时可靠性还会进一步下降。会聊天、会做事和声音自然并不是同一种能力GPT-Realtime-2.1 的 Turn-Taking 得分最高为 0.653Grok Voice Think Fast 的任务完成表现最高Gemini-3.1-Flash-Live 的 DNSMOS 最高为 3.378。https://duplexworld.github.io/index.html( DuplexWorld)5、SpotSound 发布细粒度音频时间定位模型插入 Timestamp Token短事件定位 mIoU 最高提升 27.0%浙江大学、上海 AI Lab 与上海交大团队提出 SpotSound一种面向长音频事件时间定位的 Audio-Language Model并入选 ACM MM 2026。模型通过在音频 Token 序列中显式插入时间戳 Token让模型直接学习“什么声音在什么时候发生”同时加入负样本训练以减少不存在事件的时间戳幻觉。SpotSound 现登陆了 Hugging Face 平台。如果你有较长的录音文件可以提交给他们并描述你所寻找的内容他们会帮你记录下时间戳信息。将 Timestamp Token 直接插入音频序列SpotSound 按固定时间粒度如 1 秒在对应音频 Token 前加入文本时间戳使模型通过语言模型的检索能力读取时间位置而不是单独解码密集的位置编码。构建 7.76 万条时间感知训练数据团队使用 DeepSeek-v3、Qwen2-Audio 等模型为前景声音生成细粒度描述再随机混入背景环境音同时保留声音插入时间作为 Ground Truth。SpotSound-Bench 专门测试“长音频找短声音”Benchmark 平均音频长度为 53.4 秒目标事件平均只有 4.5 秒仅占整段音频的 8.4%用于测试复杂背景下短暂声音事件的精确定位能力。时间定位 mIoU 最高提升 27.0%基于 Audio Flamingo 3 的 SpotSound-A 在 SpotSound-Bench 上较此前方法提升 20.4%在 UnAV-100 子集上提升 27.0%同时在 Clotho-Moment、AudioGrounding 等 Benchmark 上取得更高结果。加入负样本抑制不存在事件的时间戳幻觉SpotSound 将训练样本改造成包含 Negative Query 的判别式四元组SpotSound-A 在 AudioGrounding 上对存在事件的判断准确率达到 93.4%对不存在事件达到 87.9%。https://loiesun.github.io/spotsound/https://huggingface.co/spaces/hugging-apps/spotsound-temporal-grounding( SpotSound)02 有亮点的产品1、Anthropic PBC 正在洽谈收购实时生成式 AI 公司 Decart AI交易金额约为 60 亿美元据彭博社报道知情人士透露Anthropic PBC 正在洽谈收购人工智能初创公司 Decart AI交易金额约为 60 亿美元现汇率约合 405.41 亿元人民币。知情人士表示目前双方尚未最终敲定交易谈判仍有破裂的可能。由于涉及私人谈判这些人士要求匿名。Decart 致力于帮助 AI 开发者充分发挥各种不同芯片的性能同时也专注于生成式视频领域。该公司使用所谓的「世界模型」world models能够对实时视频画面进行即时修改。https://decart.ai/IT 之家2、LiveKit Agents 上线 Expressive ModeLLM 自动生成 TTS 表达标记按上下文调整情绪与语气LiveKit 在 Agents 框架中推出 Expressive Mode用一层统一的表达控制机制连接 LLM 与不同 TTS 模型。开启后LLM 会根据当前对话上下文自动生成情绪、语气、非语言声音和停顿等标记再由 LiveKit 转换为不同 TTS Provider 对应的格式。LiveKit Agents 上线 Expressive Mode大多数 Voice Agent 无论说什么都使用相似的积极语气包括传达坏消息时也是如此Expressive Mode 让 Agent 的声音能够更贴合通话者当下的情绪。在 LLM 与 TTS 之间加入表达控制层现代 TTS 已能表现温暖、犹豫、笑声和停顿但需要明确的表达指令且不同 Provider 使用不同的标记语法。Expressive Mode 让 LLM 直接在输出中生成 prosody 标记再交给系统处理后送入 TTS。更大的文本 Chunk 有助于保持表达一致性LiveKit 发现逐句流式发送给 TTS 会让模型丢失整段回复的情绪脉络并导致句间音高漂移将多句话合并成更大的 Chunk 后可改善这一问题在 Gemma 4 这类快速 LLM 上也没有带来明显的延迟成本。https://livekit.com/blog/making-voice-agents-sound-human-with-expressive-mode#try-the-live-demoLiveKit03 有态度的观点1、Sandbar CEO Mina FahmiAI 可穿戴的未来是语音但不应该一直监听AI 可穿戴设备正在越来越多地把「持续监听」当作默认设计但 Stream 戒指背后的 Sandbar 选择了另一条路语音应该成为人与 AI 交互的入口但什么时候开始听应该由人来决定。TechCrunch 在最新一期 Equity 播客中介绍了这一思路。Stream 通过按键通话来捕捉想法、提醒和待办而不是持续录音。Sandbar CEO Mina Fahmi 认为要让 AI 可穿戴真正进入日常生活关键不是让设备无时无刻都在感知而是「让人始终掌握控制权」。这背后其实是两种 Voice AI 产品哲学的分歧一种希望 AI 永远在线、主动感知另一种则认为语音足够自然但交互边界必须足够明确。对可穿戴设备来说真正重要的问题可能已经不是「能不能一直听」而是「什么时候应该听」。https://techcrunch.com/video/why-stream-ring-maker-sandbar-says-the-future-of-ai-wearables-is-voice/( Techcrunch ) Voice Agent 学习笔记了解最懂 AI 语音的头脑都在思考什么写在最后我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创感兴趣的朋友请通过开发者社区或公众号留言联系记得报暗号「共创」。对于任何反馈包括但不限于内容上、形式上我们不胜感激、并有小惊喜回馈例如你希望从日报中看到哪些内容自己推荐的信源、项目、话题、活动等或者列举几个你喜欢看、平时常看的内容渠道内容排版或呈现形式上有哪些可以改进的地方等。作者提示: 个人观点仅供参考