FinFIRST: 金融 搜索 Agent 不 只要 答对, 还 要 能 溯源
蚂蚁百灵团队联合北京大学与中金公司投资银行团队公开的 FinFIRST,把金融搜索 Agent 的评测重点从最终答案扩展到信息检索、引用来源和全过程可追踪性。

FinFIRST:金融搜索 Agent 不只要答对,还要能溯源
蚂蚁百灵团队联合北京大学与中金公司投资银行团队公开的 FinFIRST,把金融搜索 Agent 的评测重点从最终答案扩展到信息检索、引用来源和全过程可追踪性。
一、金融研究为什么需要过程评测
金融问题往往没有一条简单的标准答案。研究员需要查找公告、财报、行业数据和历史信息,确认日期与口径,形成计算,再把结论写成可复核的研究交付物。只比较最后一段文字,很难发现来源过时、数字口径不一致或结论没有证据支持。
FinFIRST V1 围绕金融信息检索、来源引用和可追溯性设计任务,强调完整研究过程,而不是只做答案匹配。
二、基准规模与评分颗粒度
FinFIRST V1 包含 123 个专家编写任务、701 个原子评价标准和 12,300 个 rubric points。任务来自真实金融研究工作流,覆盖资料发现、证据核验、数据一致性和结论交付等环节。
这样的设计将一个“回答是否好”的问题拆成许多可检查条件:是否找到正确来源、来源是否支持陈述、数字是否一致、引用是否完整、结论是否超出证据范围。
三、对金融 Agent 的四项要求
1. 先确认数据,再组织答案
Agent 应保存来源名称、发布日期、访问时间和关键片段,避免把搜索摘要直接当作事实依据。
2. 让计算链可复核
涉及收益率、估值或财务比率时,应保留输入数据、公式、单位和舍入规则,不能只输出最终数字。
3. 区分事实、推断与建议
研究报告中,事实应有来源,推断应说明逻辑,建议应标明假设和不确定性。三者混写会放大金融场景的误导风险。
4. 把引用质量纳入发布门禁
引用缺失、链接失效、时间口径不一致,都应成为可阻断的质量问题,而不是交付后再人工补救。
四、FinFIRST 对通用 Agent 评测的启示
FinFIRST 的方法可以迁移到企业知识问答、市场研究和合规审查:把最终交付拆成“证据发现—证据绑定—推理计算—结果表达—引用回溯”五个环节,并为每个环节建立原子检查项。
真正值得信任的 Agent,不是偶尔给出漂亮答案,而是能在复杂信息环境中保持数据一致、证据完整和过程透明。对于金融等高风险场景,评测结果只能辅助决策,不能替代专业人员复核。
出处:Ling Team、Inclusion AI 等,《FinFIRST: Benchmarking Search Agents for Financial Information Retrieval, Sourcing and Traceability》,arXiv:2609.25192,2026-09-21,https://arxiv.org/abs/2609.25192
出处:蚂蚁,Ling Team、Inclusion AI 等,《FinFIRST: Benchmarking Search Agents for Financial Information Retrieval, Sourcing and Traceability》,2026-09-21,https://arxiv.org/abs/2609.25192。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。