2026年8月23日·15 分钟阅读谁更擅长真实投研工作流?Fin-Agent-Bench R1 八模型实测用 36 个真实投研任务测试 8 套模型与 Agent 系统:GLM 5.3 和 Claude Sonnet 5 跑满全量组,真正拉开差距的是材料路由、权限边界与财报语义约束。