谁更擅长真实投研工作流?Fin-Agent-Bench R1 八模型实测
用 36 个真实投研任务测试 8 套模型与 Agent 系统:GLM 5.3 和 Claude Sonnet 5 跑满全量组,真正拉开差距的是材料路由、权限边界与财报语义约束。
阅读全文- 发表
- 2026年8月23日
- 阅读时间
- 15 分钟
- 主题
- AI Agent
- 状态
- 已发布
Spec sheet
Featured note · 本期研究
用 36 个真实投研任务测试 8 套模型与 Agent 系统:GLM 5.3 和 Claude Sonnet 5 跑满全量组,真正拉开差距的是材料路由、权限边界与财报语义约束。
阅读全文Spec sheet
Coverage · 覆盖范围