工程 / 官方
对冲基金BAM如何评估与治理Claude Fable 5
全球多策略投资机构Balyasny Asset Management(BAM)管理约380亿美元资产,旗下约2000名投资专业人员。其首席AI官Charlie Flanagan近日与Anthropic分享了公司评估和治理Claude Fable 5的完整路径。BAM在股票、宏观和大宗商品等领域建立了覆盖数千个真实金融任务的评测体系,Fable 5在相关子集上取得89.4%的得分,超越前一生产模型的86.1%。在并购套利分析场景中,原本需要三至五天的工作现在不到一天即可完成,智能体运行约30分钟后由人工审核。BAM同步推出内部平台BAMAgent,支持数千个自主智能体全天候运行,并通过最小权限访问、工具级权限控制和人工审核等机制确保安全边界。Flanagan强调,更强大的模型并不意味着更宽泛的授权,投资判断与问责责任始终由人来承担。
2026年对BAM而言是AI从「搜索工具」转变为「执行工具」的关键年份。首席AI官Charlie Flanagan表示,变化的核心不仅在于模型本身,还在于围绕模型构建的执行框架,例如Claude Code。这类工具使AI系统能够承担更复杂、运行时间更长的任务。向AI给出目标而非单条提示词、让其持续工作直至完成,已成为业务流程的重要转折点。
并购套利分析是这一转变的典型案例。当一笔交易宣布后,智能体会自动构建初步分析包:估算交易完成概率与时间、提取关键经济和法律条款、识别条件与里程碑节点,并标记需要投资者判断的领域。这一流程过去需要三至五天,现在不到一天即可完成,智能体运行约30分钟,随后由人工审核后方可用于决策。
BAM多年前就投入建设了完善的评测体系,并在此次Fable 5上线前进行了严格测试。评测覆盖股票、宏观和大宗商品等领域数千个具有可验证结果的真实金融任务,而非依赖通用基准或孤立演示。测试同时考察模型独立能力与其在BAM智能体环境中的表现,包括任务规划、工具选择、证据分析、错误恢复和中间结果核验等维度。Fable 5在相关子集上得分89.4%,高于前一生产模型的86.1%,尤其在复杂规划、分析和智能体执行方面表现突出。
一个令团队意外的发现是,Fable 5成功完成了此前所有模型均未能解决的一组经济学问题。BAM起初怀疑是评测系统存在问题,随即重新运行评测、独立核查任务与评分逻辑,并与Anthropic共同复核后才确认结果属实。Flanagan将其描述为「令人震惊的时刻」。目前,投资团队已将Fable 5作为系统性工作和编程任务的首选前沿模型。
在安全治理层面,BAM将其视为产品与运营模型问题,而非一次性的模型选型决策。公司围绕模型建立了多层控制机制,包括数据访问边界、最小权限原则、工具级权限管理、日志与可追溯性、重要输出的人工审核,以及边缘案例的明确上报路径。更强大的模型不会因此获得更宽泛的授权,模型只能使用经批准的工具和数据源,无法自行提升访问权限。
为支撑智能体的规模化部署,BAM历时六个月构建了内部平台BAMAgent,目前已支持数千个自主智能体全天候运行。该平台超越了原有的对话式平台,能够执行多步骤研究与分析任务,支持智能体并行工作数小时乃至数天,最终输出可供人工审核的研究成果。Flanagan建议,每家企业都应制定向托管智能体模型迁移的策略,在最大化智能体效用的同时实现企业级管理与合规执行。
要点
- BAM用数千个真实金融任务构建评测体系,Claude Fable 5在相关子集上得分89.4%,超越前一生产模型的86.1%,并首次解决了历史上所有模型均未能完成的经济学问题。
- 并购套利分析场景中,智能体将原本三至五天的工作压缩至不到一天,运行约30分钟后经人工审核方可用于决策。
- BAM将安全治理视为持续性产品与运营问题,通过最小权限访问、工具级权限控制和人工审核等机制确保边界,更强大的模型不会自动获得更宽泛的授权。
- 内部平台BAMAgent已支持数千个自主智能体全天候运行,可执行多步骤并行研究任务,Fable 5是规划与分析阶段的首选模型。
- Flanagan建议所有企业尽早投入评测基础设施建设,并制定向托管智能体模型迁移的战略规划。
原始标题:How Balyasny Asset Management evaluates and governs Claude Fable 5 | Claude by Anthropic
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。