谁更擅长真实投研工作流?Fin-Agent-Bench R1 八模型实测
用 36 个真实投研任务测试 8 套模型与 Agent 系统:GLM 5.3 和 Claude Sonnet 5 跑满全量组,真正拉开差距的是材料路由、权限边界与财报语义约束。
All notes
按时间保存研究过程。新文章会在 GitHub 更新后自动发布到这里。
用 36 个真实投研任务测试 8 套模型与 Agent 系统:GLM 5.3 和 Claude Sonnet 5 跑满全量组,真正拉开差距的是材料路由、权限边界与财报语义约束。