MIT 实测 AI 理财建议:意外靠谱,但男女差 5 万美元

越来越多人开始把理财问题抛给聊天机器人。行业调查显示,美国和英国均有超过一半的成年人向大语言模型咨询过个人财务问题,这个比例可能已经超过找真人理财顾问的人群。

问题是,这些建议究竟靠不靠谱?麻省理工学院斯隆管理学院金融学助理教授 Taha Choukhmane 与合作者用一套新方法给出了量化答案。研究论文题为《AI 理财建议:供给、需求与生命周期影响》,合作者包括斯坦福大学商学院的 Tim de Silva,以及斯隆管理学院的 Weidong Lin 与 Matthew Akuzawa。该论文获得了瑞士金融研究院 2026 年度杰出论文奖。

“有一半美国人说自己在用 AI 获取理财建议,但外界对他们究竟得到了什么建议、有没有照做,了解得非常有限。”Choukhmane 说。

研究怎么做的

评估这类建议的难点在于,结果同时取决于三件事:用的是哪个模型(供给端)、人怎么提问(需求端),以及个人处境随时间的动态变化。

研究团队的解法分三步。第一步,构建一个模拟人一生中收入、职业、投资与纳税如何演变的模型,作为判断”什么算好决策”的基准。第二步,招募 1000 名成年人,让每人各写三段提示词:描述自己的处境、询问该存多少花多少、询问该怎么投资——其中约一半人此前刚用过 AI 咨询财务问题。第三步,把这些真人写的提示词分别投给 GPT-5.2、GPT-5.6 与 Gemini 3 Flash,将回答转换成具体的财务决策,再模拟从 22 岁到 89 岁的完整人生路径,过程中还会随机加入失业等冲击事件。

最后,团队又用学者写法的”学术提示词”重跑一遍作对照。这类提示词会补全个人的年龄、就业状态、收入与储蓄余额,并明确给出预期寿命、生活支出、退休年龄、失业风险与收入波动等假设,同时约定现行税法与社会保障规则不变。

结论一:建议质量超出预期

模拟结果显示,无论提示词出自普通人还是学者之手,模型给出的建议都把人推向了更接近生命周期理论的方向:工作期多存钱、退休后逐步支取、大比例配置分散化的股票基金,并在 45 岁之后降低权益仓位。

在 AI 指导下,30 岁以上的模拟对象几乎全都攒出了可观的储蓄缓冲,参与了股市并保持分散配置,随年龄增长逐步转向更安全的资产。不少案例中,退休时的模拟财富超过了 100 万美元。

“建议的质量让我们有点意外,”Choukhmane 说,”尤其是看过人们实际提的那些问题之后——建议能和学界公认的良好财务原则对上,本来并不是理所当然的事。”

“这些系统并不是为优化财务决策而设计的,它们完全可能强化坏习惯,或者只挑用户爱听的说,”他补充道,”综合来看,这些结果说明 AI 有可能提供一种低成本、覆盖面广的财务指导,弥补传统顾问在高收费、偏见与利益冲突方面的不足。”

研究还发现,模型并不只是顺着用户的话说,而是会主动扩展话题。流动性问题出现在 83% 的 AI 回答中,而主动提及它的用户只有 6%;储蓄的差距同样明显——只有 20% 的人在提问中提到,却出现在 76% 的回答里。模型也频繁推荐高收益储蓄账户、政府债券这类更稳妥的分散化选项。

结论二:短板集中在”随机应变”

模型的弱点则集中在更微妙的层面。它倾向于依赖简单的经验法则,在情况发生变化时调整得不够到位。

一个典型例子是失业。对刚刚失去收入的人,模型会建议把开支砍得过狠,哪怕对方账上还有充足储蓄。此外,模型在投资组合上偏向被动漂移而非主动再平衡,对退休后应当逐步支取的部分也建议得偏保守。

换用学术提示词之后,表现明显改善:消费平滑做得更好,对经验法则的依赖减少。但即便如此,主动再平衡的建议仍然偏少。

“普通人不会像金融学教授那样写提示词。”Choukhmane 说。研究中一条典型的真人提问是这样的:”我从 50 美元起步、之后每月固定追加 25 美元,该投到哪里?”

结论三:谁来提问,结果差很多

最值得警惕的一项发现是:模型给出的建议会随提问者的性别、金融素养和 AI 使用经验系统性变化,而这些差异经过一生的复利累积,会变成退休时实打实的财富差距。

论文摘要给出的总体量级是:不同群体之间的退休财富差距在 4% 到 5% 之间。具体来看:

  • 面对男性和金融素养较高者写的提示词,模型推荐了更高的权益配置比例。这一差异累积下来,女性和金融素养较低者在 60 岁时的财富要少约 5 万美元(4%)
  • 对此前没用过 AI 咨询财务问题的人,模型推荐了更低的储蓄率。照做的结果是,他们在 60 岁时比有 AI 使用经验者少了将近 10 万美元(6%)

差异来自两个源头。其一是提问方式本身不同:女性更常在提示词中使用”家庭””日用采买””付款”这类词,男性则更多使用”策略””加密货币””增长”。其二是模型自身——即便面对同一个问题,只要标注提问者是女性而非男性,建议也会发生变化。

在性别造成的财富差距中,约三分之二可归因于男女提示词写法的差异,剩下三分之一来自模型对相同提示词给出不同建议。Choukhmane 认为,后一种模式既可能是模型在对不同人群的偏好或处境做出合理推断——理想情况下应当向用户明确说明——也可能是从训练数据中习得的偏见。

他同时提醒,并非所有差异都是问题:”我们确实希望模型有不同的倾向,因为男性和女性本来就不同,预期寿命和收入风险都不一样。”真正的困难在于目前缺乏公认基准:”只有当业界对建议应当如何随人口特征变化形成一套认可的框架,大模型才谈得上朝正确方向改进。”他表示对这一点仍抱有期待。

对普通用户和金融机构的启示

对使用者而言,Choukhmane 的建议是:除了留意偏见、在当前阶段主动要求模型防范偏见之外,关键还是把提示词写好。那些建立在生命周期规划、投资组合理论与真实财务假设之上的提问,能显著改善关于消费与储蓄的建议,减少笼统的经验法则式回答。

“真正的挑战是,如何让 AI 理财建议同样惠及那些金融素养不高、提示词写不完美的人。”他说。一个可行的思路是:先把 AI 当作理解财务知识的工具,而不是直接照单执行的指令源。

他还认为,AI 与真人顾问之间是互补关系。真人顾问一年可能只见两次面,AI 则能帮人在日常中实时落实他们给出的方案;而对那些请不起顾问的人来说,AI 提供了一条廉价的获取建议的途径——”最需要理财建议的人,往往恰恰是资源最少的那批人。”

对金融机构来说,这项研究还揭示了一个新变化:模型经常主动推荐用户完全没提过的账户类型、金融产品和服务商。研究发现,先锋领航(Vanguard)的投资产品出现在 6% 的模型回答中,安硕(iShares)产品出现在 3.4% 的回答中,而在用户提问里提到这两家公司的比例还不到 0.4%。这意味着获客的关键可能正在从传统营销和搜索曝光,转向产品在大模型回答中如何被描述。

需要说明的是,这项研究基于美国的税制、社保与退休金体系设计,具体的储蓄率与配置比例结论不宜直接套用到其他市场;文中所有内容仅为研究结果转述,不构成任何投资建议。

来源:麻省理工学院斯隆管理学院官网(Ideas Made to Matter 栏目及新闻稿),工作论文编号 MIT Sloan Working Paper 7377-26


发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注