打电话给客服,人类的耐心大约是 1.5 秒——Daily 团队(Pipecat 开源框架背后的公司)在发布 PhoneLLM Alpha 1 时给了个硬数字:voice-to-voice 延迟要压在 1,500ms 左右,通话体验才自然。而他们测得 GPT 5.6 Terra 快速模式的 P95 首 token 延迟约 1,900ms——也就是说,光 LLM 这一环就把预算撑爆了,还没算 STT、TTS 和网络。这就是 PhoneLLM 存在的理由:一个专为电话场景训练的开源权重模型。
30B MoE,3.5B 激活,只为接电话
PhoneLLM Alpha 1 的底细写在模型卡里:基于 NVIDIA Nemotron 3 Nano 30B-A3B 做全参数微调,训练用 NVIDIA NeMo 框架;架构是 Hybrid Mamba-Transformer MoE,总参数 30B,激活只有 3.5B;上下文 262,144 tokens;BF16 safetensors;BSD 2-Clause 许可证,无商用限制。推荐的推理设置很干脆:temperature=0、thinking 关闭——因为模型就是按这个口径训的。
场景也收得很窄:金融、医疗、零售、酒店的 inbound 客服 + 常规 outbound 外呼。它要解决的是一个非常具体的痛点:关掉 thinking 之后,大小模型在多轮长对话里的工具调用都不可靠——模型嘴上说「好的,桌已订好」,实际上根本没调用工具。PhoneLLM 的训练目标就是在不开思考链的前提下,该调工具时调对工具。
每分钟 0.00025 美元是怎么算出来的
模型卡给了一笔很工程化的账:单张 B200 塞 44 个并发 agent 进程(双卡节点 88 个);Modal 上 B200 基础价 $6.2496/小时,区域锁定乘 1.5 得 $9.3744,按 70% 利用率折算 $13.392/小时,即 $0.2232/分钟;除以 88 个并发,得到每个 agent 每分钟 $0.00025。单请求 TTFT P95 在 B200 上低于 100ms;配 Modal AutoEndpoints 的定制配置后,在 sub-600ms P95 首 audio token 目标下,最大并发大约是 vLLM 通用 cookbook 配置的两倍。
Daily 的官方口径更大胆:电话任务表现与 GPT 5.6 Terra 相当,成本便宜 94%,P95 首 token 快 1,300ms。联合创始人 Kwindla Hultman Kramer 在 X 上的说法是 1/3 延迟、1/18 成本——两处数字在数学上对得上(94% ≈ 1/18)。
自建考场的问题
这些数字全部来自 Daily 自己的 PhoneBench v1:LLM 裁判对人类标注做校准,评的是电话语体、工具调用准确性、言行一致(say/do consistency)、事实接地、对话连贯、鉴权与升级纪律、呼叫结果。独立媒体 explainx.ai 的报道把该泼的冷水泼足了:Alpha 1 是开发方自己贴的标签;benchmark 是自建的,没有第三方公开榜单复现;数字对配置敏感(temperature=0 + 关 thinking 才复现得出来);而且是「自托管专用部署 vs 通用托管 API」的不对等比较——Terra 的延迟和成本是 OpenAI 端点零基建直接给的,PhoneLLM 的数字前提是你自己运维 B200。GPT-5.6 Terra 在 7 月底降价后是 $2/$12 每百万 token,这个对比框架下每分钟成本怎么折算,两家口径并不在同一张账本上。
所以呢
即便把厂商口径打对折,这个发布仍然值得注意:它不是「又一个小模型」,而是把「任务专用微调 + MoE 低激活 + 自托管并发工程」三件事拧在一根延迟轴上。Daily 的判断是行业正在转向小开源专用模型——用生产 agent 轨迹和私有数据按月迭代权重。电话客服恰好是延迟、成本、工具可靠性三重约束最苛刻的场景之一,PhoneLLM 能不能站住,等第三方复测;但「用 1/18 的成本干一个具体工种」这条路线,已经有人交卷了。