嵌入与重排模型的老玩家 Mixedbread 发布了第一款专用搜索智能体模型 Toast 1:它把智能体工作流里最烧钱的检索循环整体接管——自己拆子查询、调用搜索工具、读源、筛证据,只把整理好的上下文交回主模型。官方称其搜索质量打平或超过 Claude Opus 5 与 GPT-5.6 Sol,价格最高便宜 10 倍、速度快 12 倍(官方发布)。
逻辑:让贵的模型只干贵的活
Toast 1 的定位是「专用检索子代理」。它可以独立跑深度搜索,也可以作为 subagent 挂进 Codex 这类编码智能体——主模型负责推理与决策,取证环节整体外包。官方演示里,一条就业率比较查询由它拆成 16 次工具调用、3 轮完成,耗时 5.33 秒。上下文窗口 131K tokens,通过标准 Chat Completions API 接入,也提供 OpenCode 集成和开源 harness。
两个关键成绩(均为厂商自报)
金融基准 OfficeQA Pro V2(Databricks 发布,90 题):GPT-5.6 Sol 在 Codex 中挂上 Toast 1 作子代理后,答案正确率达到 70%、单任务成本约 1.15 美元——官方称这是 Databricks 评测系统里的最高分;对照 Claude Fable 5(Databricks Genie)为 60% @ 约 4 美元,GPT-5.6 Sol(Codex)不挂 Toast 1 只有 33%。
法律基准 Harvey LAB 律所知识库(随机 33 任务子集):三种检索配置的任务得分完全相同(55 分),但 token 消耗从原生智能体的 80.6M 降到 23.0M(先换 Mixedbread Search 省 42%,再加 Toast 1 再省 51%),轮次从 21.7 降到 11.2——同分,token 少用 3.5 倍,官方称成本降幅超 60%。
标准配置下单次搜索成本约 0.016–0.023 美元、中位延迟 8 秒;最高质量的 fusion 配置约 0.05–0.07 美元、11 秒。官方称在同等性能的系统里便宜 7–11 倍,而对照的前沿模型检索智能体延迟在 20 秒到 4 分钟之间。
定价与边界
发布期定价:输入 0.30 美元/百万 tokens、缓存输入 0.036 美元(缓存写免费)、输出 0.72 美元/百万 tokens,新用户送 5 美元额度。值得注意的边界:它是闭源 API 模型而非开放权重;BenchLM 明确将其标注为专有模型,且因官方自报成绩没有开放协议的评测表,暂不给排名——70% 那项成绩属于 GPT-5.6 Sol+Toast 1 组合系统,不是 Toast 1 单独跑分。官方也在脚注里承认,同类专用搜索智能体还有 SID-1 与 Chroma 的 Context-1,这个品类正在快速成型。
我的看法
Toast 1 最值得记住的不是某个跑分,而是它把「智能体经济学」摆上了台面:当推理模型的单 token 价格不再降、而智能体任务又动辄百万 token 级检索时,把检索循环外包给一个便宜的专用小模型,是比“等模型降价”更现实的降本路径。但所有关键数字都来自厂商自报,第三方复现之前宜观望;它也再次印证了行业的分工趋势——通用推理归前沿大模型,脏活累活归专用子代理。对做 RAG 和研究型智能体的团队,5 美元额度值得一试。