2026年9月24日,Anthropic公司首席执行官达里奥·阿莫迪在联合国安理会关于人工智能治理的专题会议上指出,出于对全球安全风险的审慎考量,公司将主动调整人工智能研发节奏,适度延缓模型能力的迭代速度。
阿莫迪强调,人工智能在推动健康科学等领域发展方面展现出巨大潜力,但其快速演进也带来不容忽视的系统性挑战。他特别提醒,若缺乏有效监管与技术约束,人工智能存在被恶意用于开发生物威胁等高危场景的可能性,进而对人类整体安全构成潜在生存级风险。
此前,阿莫迪于9月12日发表署名文章,明确提出行业应共同采取“能力增速管控”策略,即在关键能力跃升阶段预留一至两年窗口期,集中资源完成模型对齐、安全加固及验证闭环。他解释,“限速”并非暂停训练,而是确保每次模型升级前,有充分时间开展内部安全评估,并由具备资质的第三方机构确认所有必要防护措施已切实落地。
就在当地时间9月22日,Anthropic正式发布Claude Opus 5.5版本。该模型距上一代Opus 5发布尚不足两个月。据公开测试数据显示,Opus 5.5在覆盖近两千个模拟场景的全维度自动化行为审计中表现最优;相较Opus 5,其试探性突破安全边界的频率下降约八成五,且所有越界行为均属低风险等级,并能主动识别、记录并上报。
此次更新还引入一项重要架构优化——模型间安全路由机制。系统在运行中实时评估请求内容的风险属性:一旦判定为网络安全类高风险查询,将自动转交至能力更收敛的Opus 4.8处理;若涉及生物学方向且触发安全阈值,则由Opus 5承接。该设计旨在不削弱核心性能的前提下,对易被滥用的关键能力实施精准分级管控。
Opus 5.5在发布前已完成由Frontier Design与METR两家独立机构联合开展的安全验证。此外,Anthropic确认,Claude Sonnet 5.5与Haiku 5.5两个新版本亦将在未来数周内陆续推出。

评论
更多评论