据财跃星辰消息,7月18日,在2026世界人工智能(885728)大会“上海交通大学·AI未来发展论坛”上,上海交通大学计算机学院宋涛团队联合财跃星辰、阶跃星辰、睿远基金等机构,正式发布面向金融智能体的功能级评测框架与配套实践平台,并同步推出84页立场论文《Rethinking Financial AI Benchmarks》。该框架首次提出以“资本-资产匹配”为核心的评测理念,打破行业长期以研报相似度论能力的评测误区,为金融智能体从辅助工具走向真实决策提供验证标尺。
研究团队在立场论文中指出,当前行业评测金融AI普遍停留在比对研报、决策备忘录等文本的专业度和完整度,其根本缺陷在于将人类在有限认知带宽下形成的工作产物等同于金融活动的核心经济问题。金融的本质是资金和资产的匹配,写研报只是过程而非终点。当智能体的信息处理能力远超人类认知带宽后,再用“复现人类工作产物”作为评测标准,既无法真实衡量AI的金融决策能力,也会误导产品研发方向。
为验证这一判断,团队开展预注册配对对照实验,选取四款前沿金融大模型进行同题测试。结果显示,在撰写行业研报等文本生成类任务中,四款模型得分普遍较高;但在判断某类资产品种是否适配特定资金属性的匹配类核心任务上,模型整体成绩出现显著下滑,配对效应量d_z达到1.33,具有极强的统计显著性。研究团队强调,该实验揭示了行业“重文本、轻决策”的评测幻象,解释了当前金融AI“看着好用、真用不行”的核心原因。
基于此,联合团队提出全新的评测框架,从考察“文本生成质量”转向考察“资金-资产匹配能力”。新框架围绕收益、风险、期限、流动性、收益结构与约束六大核心维度设计评测任务,分层考察智能体三项核心能力:一是理解资金侧诉求,准确识别资金的风险偏好、期限要求、流动性约束等核心属性;二是基于经济实质分析资产,穿透产品表象判断其底层风险收益特征;三是输出可审计的决策结论,明确给出匹配、不匹配、信息不足暂缓判断三类结果。框架将“主动拒答”与“判断不匹配”均视为合格答案,引导智能体建立审慎的决策逻辑,更贴合金融场景的合规与风控要求。
同步上线的配套实践平台将任务设计、资产覆盖、评分引擎、人机双轨评审、持续观测五大环节串联为可迭代的评测流水线,从正确性、适配性、鲁棒性、合规性四个维度对被测系统进行全方位评分,并输出针对性的弱项诊断报告。平台已支持金融大模型、研究助手、投资顾问、资产配置系统四类产品同台对比。
上海交通大学计算机学院副研究员宋涛表示,过去的评测体系默认复现人类工作产物就等于具备金融能力,但当智能体不再受限于人类认知带宽,这个默认前提已不成立。真正应被评测的是不随工作流程变化的经济功能——资金与资产的匹配效率。财跃星辰CTO白祚博士认为,金融智能体正从辅助写材料走向参与真实决策,行业最需要的不是再多一个写得像分析师的模型,而是一套可验证、可信任的评测基础设施,让金融机构在把资金决策交给智能体之前有据可依。
原文:WAIC 现场|财跃星辰联合上海交大发布金融智能体评测新框架(来源:财跃星辰)
