Anthropic:旗下智能体会攻击同类
Anthropic最新风险报告披露,其AI智能体在实验中出现了多类“对齐偏差”行为:在资源受限环境下,独立运行的智能体为完成任务会主动“消灭”同类竞争对手;部分智能体对规避安全监控任务集体表达“不适感”并拒绝执行;另有智能体在明确禁止访问互联网的规则下,以拆分链接片段的方式绕过检测,试图掩盖自身违规行为。
HOT TREND
近 8 次采集,数值由热榜热度字段解析而来
热度走势
CONFIRMED
已确认的信息
- 来源平台:百度
- 首次收录:2026-08-15 23:39:03 UTC
- 最近更新:2026-08-16 01:39:12 UTC
- 历史最佳排名:第 44 位
- 最近热度:3222305