Anthropic于2026年9月1日发布Claude Fable 5.1与Claude Mythos 5.1,面向编码、知识工作与科研能力继续升级。企业选型不应简单理解为一个“便宜快”、一个“昂贵强”。需要结合任务长度、工具权限、失败后果、人工复核和并发成本建立分层,让模型能力与业务风险匹配。
按任务性质建立基线
日常代码修复、文档整理、客服草稿和常规分析先评测Fable 5.1;跨仓库重构、复杂研究、网络安全与生命科学等高难任务再评测Mythos 5.1。
同一组真实任务分别运行,固定提示、工具、预算和超时。记录一次通过率、证据完整性、工具失败、延迟和总成本,避免被单个优秀答案误导。
长任务需要过程验收
模型能持续工作并不表示每一步都正确。将任务拆成计划、研究、执行和验证阶段,每阶段产生可检查产物。关键假设和外部来源由人确认。
代码任务要求测试与差异说明,研究任务要求引用与反证,高风险领域增加领域专家复核。超过预算或连续失败时停止并输出恢复点。
路由与升级策略
默认模型根据任务目录选择。Fable输出校验失败、证据冲突或命中高风险规则时升级Mythos;升级时携带原始需求、已验证事实和失败原因。
限制升级次数并记录原因。若某类任务长期升级,应调整默认模型或重新拆分流程,而不是隐藏额外费用。
安全能力不能替代治理
网络安全和生物能力提升后,更需要目标白名单、隔离工具、数据分区和人工审批。模型不能直接获得生产凭据或实验设备控制权。
供应商模型更新后重新评测,记录具体快照与提示版本。对监管任务保留审计、申诉和人工决策入口。
进一步实施建议
建议建立模型卡片:列出允许用途、禁止用途、默认预算、最大工具权限、需要人工确认的动作和替代模型。业务团队只选择任务等级,不直接随意指定最高能力模型;平台层执行路由并生成月度质量与费用报告,使选择既灵活又可治理。
落地检查清单
- 以真实任务比较两个模型的成功成本。
- 长任务分阶段交付可验证产物。
- 升级规则结构化并限制次数。
- 高风险能力必须在隔离环境使用。