要点总结基于 Qwen3 - TTS 1.7B 的 CustomVoice 实现在单张 NVIDIA H100 SXM 上每秒达 10 个请求p95 首次音频响应时间低于 50 毫秒还能实时播放。在泊松开环流量下对比五种方案仅该方案 p95 TTFA 低于 50 毫秒10 RPS 时仍保持此水平20 RPS 时控制在 100 毫秒以下。系统 10 RPS 时每秒约生成 630 个字符满负载运行每 100 万个字符成本约 2 美元远低于 ElevenLabs V3 和 Cartesia Sonic 3.5且它们 TTFA 更高。已开源实现代码和基准测试代码若对定制部署或优化多模态推理工作负载感兴趣可交流。定义“实时”TTS实时 TTS 服务器目标涉及四个方面低可听 TTFA、零缓冲不足、高吞吐量、输出质量良好。选择 Qwen3 - TTS CustomVoice 1.7B 模型因其受欢迎且使用许可宽松。目标是在单张 NVIDIA H100 SXM 上实现低 p95 可听 TTFA、零缓冲不足和高 RPS。基准测试在泊松开环流量下运行 5 分钟模拟真实负载参考 Fireworks AI 大语言模型基准测试方法各引擎通过单个 HTTP 请求接收完整文本音频流式输出检测可听 TTFA重建播放过程并评估音频质量。其他引擎表现如何各引擎在 1 RPS 时的上游/默认测试结果显示默认结果有提升空间针对延迟、连续性、质量和吞吐量要求进行了调优。去除前导静音模型首个 PCM 数据可能包含数十毫秒静音增加可听 TTFA。添加动态裁剪功能检测持续语音去除起始前样本可使 TTFA 缩短约 80 毫秒但不加快推理速度。调整帧累积策略调整解码和释放音频块前收集的编解码帧数。较小初始块降低 TTFA 但减少缓冲空间、增加解码器工作频率较大块便于批量处理、使播放更连续但延迟首个可听音频输出。有效配置是先小后大。不同引擎有类似块或步长控制参数通过迭代找到符合低 p95 TTFA、零缓冲不足且负载增加时稳定的配置。现有服务引擎调优后的性能各引擎去除前导静音和调整帧累积策略后无缓冲不足情况的性能表现为VoxServe 在 1 RPS 时 p95 TTFA 低于 50 毫秒其他三个引擎未达RPS 约 6 时所有引擎 p95 TTFA 达或超 100 毫秒。我们如何优化 Qwen3 - TTSQwen3 - TTS 是三部分组成的模型用于分层多码本生成。关注服务系统如何协调异构任务采取了以下优化措施。统一三个模块的调度多数实现将其分两阶段我们更进一步将 Talker、Code Predictor 和 Codec 作为独立可调度任务放在共享调度平台灵感源于 M*。调度器可根据任务紧急程度安排工作分开模块可创建更短工作单元让调度器交错处理请求。根据语音流式传输需求进行调度语音流式传输有不同紧急情况首个音频块到达前优先处理任务播放开始后接近播放截止时间的流才视为紧急任务。调度器选紧急请求为锚点用兼容任务填充批量处理利用共享调度平台有效利用 GPU 资源。利用 Code Predictor 的规则结构Code Predictor 执行规律每帧固定步骤填充音频码本。利用其结构预先分配 KV 缓存捕获帧生成循环为 CUDA 图使用 Triton 注意力内核降低延迟简化执行系统。基于缓存状态重构 CodecQwen3 - TTS 的 Codec 由变压器和 CNN 组成简单实现会重处理帧历史。使用基于状态缓存的 Codec保留上下文和卷积状态增量解码重用缓存状态首个音频全解码后切换到增量解码还动态调整块大小。其他服务优化措施为预定义批量大小捕获 CUDA 图就绪任务组超最大捕获批量大小时拆分处理。避免不必要 CPU - GPU 同步推迟终止检查支持模块化语音到语音系统的输入流式传输降低端到端延迟。下一步计划Qwen3 - TTS 是多模态推理工作起点计划扩展到图像、视频、世界模型及模型微调最终愿景是实现对现实世界的 1:1 模拟。团队在多模态人工智能研究和基础设施领域专业开源 TTS 模型 Dia 下载量超 200 万次成员来自 YC、KRAFTON 和 NAVER 等公司有相关会议研究成果和竞赛金牌Nari Labs 获 Y Combinator 支持欢迎交流多模态相关工作。