8 月 28 日,蚂蚁集团携手中金公司及行业专家推出蚂蚁百灵首个金融增强模型 Ling-3.0-flash-Fin。它延续 Ling-3.0-flash 的模型架构和长上下文能力,保持 124B 总参数、5.1B 激活参数的配置,在此基础上通过金融语料持续预训练、领域后训练和工具使用优化,强化对年报、财务工作簿、多份研究材料等复杂金融内容的处理能力。模型权重预告下周正式开源,OpenRouter 同步提供为期一个月的限时免费 API 调用,Vercel AI Gateway 免费期至 9 月 25 日。

不换基座,只做领域增强

这套做法和 DeepSeek-V4-Flash 的"只换后训练不换权重"思路一致:基座不动,靠金融语料持续预训练加领域后训练把模型往专业场景推。官方把能力收敛为四项——信息检索、研究推理、估值建模、研报撰写。官方演示里,模型直接处理了一份 Google 2026 年 Q2 财务表,文件包含 7 个工作表和 5000 多条公式,模型可以更新实际数据、调整公式、刷新跨表引用和图表;另一个任务里它连续调用 23 次工具,寻找 Google 月度 Token 用量的历次披露,并核对来源、日期和统计口径。

自测成绩:部分任务超过旗舰,但别只看官方口径

评测方面,模型在蚂蚁与中金联合打造的 FinFIRST 基准,以及 FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等金融智能体基准上进行了测试,覆盖金融信息检索、投资研究分析、金融长程任务执行、估值建模、银行业务应用。官方将其与 GPT-5.6-Sol、Claude Opus 5、Gemini 3.7 Flash、Kimi K3 等模型比较,结果并非每项第一,但在部分 Finance Agent 任务上超过部分旗舰模型。通用能力方面,AA Intelligence Index v4.1.1 得分从基础版的 38 提升至 41。其中 FinFIRST 由 50 余名金融专业人士参与设计,从结果、过程和证据三个层面评估答案质量,基准本身也将于近期开源。

该泼的冷水:权重还没落地

第三方观察者的提醒值得记下:截至目前,Ling 3.0 家族的其他成员(Flash 的 BF16/FP8、Tiny 的 BF16/FP8/INT4)都在 Hugging Face inclusionAI 组织下开放,Fin 版尚无仓库,没有可下载权重,也没有 Artificial Analysis 独立页面或第三方复现数字——所有能力声称暂时只能对官方口径。规格上它是纯文本模型,上下文窗口 256K,单次最大输出 32768 tokens,支持 tools/tool_choice 与 reasoning 参数,推理模式默认开启。

所以呢

金融是合规要求最重的行业之一,基座 Ling-3.0-flash 以 MIT 许可开源,若 Fin 版按承诺在下周开放权重,金融机构就能在私有环境里跑一个投研定向模型,这比 API 调用的想象空间大得多。"下周开源"这四个字,就是接下来最值得盯的观察点。(IT之家报道)