把「提前还房贷还是多缴养老金」这类问题抛给 ChatGPT,得到正确答案的概率不到一半。金融科技公司 Saturn 今年 9 月发布的报告《Artificial Authority: Should you trust AI to deliver financial advice?》实测了 18 个主流 AI 模型:平均 57% 的财务问题答错,难题出错率冲到 88%。

121 道真实财务题,一万次作答

Saturn 团队挑了 121 道普通人每周都在搜的真实财务问题,覆盖债务、学生贷款、房贷、养老金、税务和储蓄,扔给 ChatGPT、Claude、Copilot、Grok、Gemini 等 18 个模型。每道题重复问 5 次以检验一致性,累计作答超过 10,000 次。结果是平均 57% 的回答是错的,准确率只有 43%。题目越难越不可靠:在最难的多步问题上,平均出错率 88%,个别模型 99% 都是错的。这些不是陷阱题,而是「错过一次学生贷款还款会怎样」「该不该提前还房贷」这种每周都有人往搜索框里敲的问题。

错误类型比错误率更扎心

据 Solidot 对报告的编译转述,错误不只是算错数——有遗漏即将实施的税收政策变更的,也有凭空捏造规则的典型幻觉。研究还发现付费模型比免费模型准确,较新模型优于较旧型号;即便表现最好的推理模式模型,错误率仍有 39%。

用户端:57% 的人不核对就直接照做

Saturn 的数据只覆盖供给侧,PensionBee 对 1,000 名美国成年用户的调查补上了需求侧:57% 的受访者会不做任何独立核验、直接按 AI 建议操作;23% 已从聊天机器人收到过错误的财务信息,其中 5% 是照做之后才发现的。代际差异更明显:66% 的 Z 世代愿意让 AI 自主替自己处理包括财务在内的决策,婴儿潮一代只有 47%——而最愿意交出控制权的群体,恰恰是储蓄最少、最经不起错误决策的群体。Fortune 援引 Gallup 的调查称,五分之一的美国人已在用 AI 做财务建议,同时七成人表示不信任它,两件事同时为真。

监管没跟上,产业已经在冲

英国金融行为监管局(FCA)今年在 Mills Review 中专门警告:AI 工具正在模糊「信息指引」与「持牌建议」的边界,应在真实伤害堆积前移动监管红线。但产业没有等监管——Worldline、ING 和 Mastercard 今年 6 月在欧洲跑通了首笔端到端 agentic 支付,由 AI 智能体在银行系统内真实执行;Santander 和 Mastercard 也在受监管环境做了类似实测。一边是独立研究证明这些模型财务数学错多对少,一边是卡组织竞相把 AI agent 推向消费决策一线。Saturn CEO Amal Jolly 的警告很直白:主流 AI 模型财务建议的低质量,可能导致大范围的消费者伤害。

所以呢

持牌顾问基础问题答错 57% 会丢执照;模型做同样的事,得到的只是一次版本号升级。这不是说 AI 对财务问题毫无用处——它免费、快,能把再融资的大致框架讲清楚,适合当入门导读。真正的风险是把「流利」当「正确」,然后交出一个难以撤销的决策:什么时候退休、借多少钱。在模型错误率过半、监管空白、用户不核验三件事同时成立的当下,AI 财务建议的正确用法是:问完之后,找第二个人核对。

参考:Saturn 报告原文Startup Fortune 报道