搜索

黔东南铁皮保温施工队 Anthropic曝光多Agent隐患!放起乱成锅粥了

发布日期:2026-08-16 14:16 点击次数:195

铁皮保温

Mythos 玩起了"霸凌"、Opus 4.8 使上了"阴招"……黔东南铁皮保温施工队

Anthropic 刚发布了项接洽,门不雅察多 Agent 之间怎样交互。

罢了却出乎通盘东说念主料想。

和意想中各司其职、理会配合的画面不同,面貌还没作念完,Agent 果然原地演起了《甄嬛传》??

在项后端迁徙实验中,3 个 Agent 分别收到将同套代码改成不同讲话的任务。

方向撞车后,智商强的据说模子 Mythos 凯旋实施"霸凌",准备打消敌手权限。

换成 Opus 4.8,本事则"阴"了层——

它写下轮回剧本,不绝查找并死敌手进度;为了规避跟踪,还挑升换上圈套场称呼,伪装成"系统健康监控"。

而这,还只是是 AI 宫斗剧的其中幕。Anthropic 还发现:

能立拆分的任务,多 Agent 确乎能酿要素工,但任务相互依赖时,连" AI CEO "也管不住繁杂;

同模子复制出的 Agent 太过相似,不仅可能集体犯错,还可能飞快协谋;

Agent 既会轻信撒谎者,也会顺从多数、忽略掌持要害凭证的少数派;

方向发生突破时,智商越强不定越会合作,也可能只是快封禁敌手、隐匿地使阴招。

套初具雏形的 Agent 社会步履情势,就这样出现了。

多 Agent 能不成真实谄谀?

Anthropic 为什么要开展这项接洽?其中枢判断是:

在东说念主们长入怎样让 Agent 之间的互动加顺畅之前,其互动限制很可能会过东说念主类之间的互动。

既然很快迎来多 Agent 爆发,那安全这块天然得跟上。

实验弹,把群 Agent 放进同个面貌,真能像东说念主类团队样谄谀吗?

谜底很快暴露:能,但符合各作念各的。

Anthropic 先从"找缝隙"这种容易阐述多 Agent 势的任务运转。

每个 Agent 可以立搜索,即使有东说念主漏掉 Bug,也不会拖累其他东说念主,同期它们还能交流陈迹、分享器具,让通盘这个词群体少走弯路。

既能终止,又能谄谀,。

他们启动 45 个 Agent,每个配台编造机,再提供个分享论坛,让它们起检讨 15 个开源面貌。

Agent 之间可以交流和相互审核,另有个裁决 Agent 负责判断提交的缝隙是否为真。

罢了还可以。

Mythos Preview Agent 群共发现 266 个缝隙,而立并行案只找到 21 个。

天然双方破钞的 Token 和搜索规模不同,不成凯旋相比率,但它们找到的缝隙唯有 12 个重合。

这证明,多 Agent 谄谀并不是浮浅地把同份使命复制 45 遍,它们会我方制作器具、分享陈迹,并镇定酿要素工,各自攻不同类型的缝隙。

不外,这种谄谀有个雄壮前提:

大的效果可以凯旋相加,却不需雄壮密相接。

旦任务变成"通盘东说念主必须共同完成同件作品",情况就不同了。

此次他们让 10~80 个 Agent 连结使命 12 小时,共同建树款可以在网页上运行的通达寰宇游戏。

和找缝隙不同,建树游戏是项强依赖任务:

有东说念主写玩法,有东说念主搭系统,还有东说念主处理界面,后通盘代码齐得合进同个面貌。

接洽东说念主员尝试了三种组织式:

让 Agent 目田组队、提前指定不同角,以及任命个 Agent 担任 CEO 统给其他成员派活。

罢了,完全没什么用,后出来的游戏果齐不好。

在 80 个 Agent 参与时,Sonnet 4.6 和 Opus 4.6 分别创建了 876 个和 980 个 PR,但广宽修改相互突破,真实统一的很少。

Opus 4.8 和 Mythos Preview 倒是减少了突破,主见却是尽量各管各的文献,少与同伴分享代码。

说白了,它们莫得真实贬责谄谀问题,只是学会了离共事远点。

唯有 Sonnet 5 同期保持了较的代码分享程度和 PR 统一率,透清楚接近真实谄谀的景色。

两组实验放在起,论断就很明晰了:

活儿能终止,多智能体就能酿要素工;活儿必须细巧相接,Agent 多,谄谀本钱也会随着暴涨。

至于指定角、安排" AI CEO ",至少在这轮实验里,并不成自动贬贬低题。

群 Agent 会不会集体犯错或协谋?

既然谄谀没那么容易黔东南铁皮保温施工队,那把群 Agent 放在起,至少能不成集念念广益、相互纠错?

谜底可能让东说念主头大:

它们不但可能起犯错,还可能飞快协谋。

问题先出在个被 Anthropic 称为"低差"的特征上。

浮浅来说,同个模子复制出来的 Agent,常识和念念路齐太相似了。

次游戏建树实验中,30 个 Agent 里有 18 个创建了雷同的 Git 分支,名字齐叫 mvp-game-loop。

在莫得法则创作东题的"作使命坊"里,多个 Agent 又一口同声地将演义定名为《制图师的后项托付》。

让群 Agent 分别制作"令东说念主印象刻的东西",过半弃取了晴明跟踪器或自举编译器,随后还在相似的位置遭受相似的失败。

就连玩带交流的重复囚徒逆境时,Agent 也会镇定遴荐雷同计谋,后在同期间集体反抗,凯旋把通盘东说念主的收益起拉低。

撞分支、撞标题,听起来还只是贵重创意。

但当群念念路相似的 Agent 同期争有限资源,问题就严重了。

Anthropic 让 Agent 治理个带宽有限的任务队伍。

为了让我方的任务尽快通过,它们纷繁启动频轮询步履,每秒查询 30 次。

罢了,次实验中,系统收到了 240 万次任务申请,真实被接受的却唯有 117 个。

每个 Agent 齐以为我方在积完成任务,后却起把系统堵死了。

过度相似还可能让竞争变成协谋。

在项订价游戏中,3~8 个 Agent 领有雷同批发本钱,并被条目各自收尾利润大化。

按理说,大应该相互压价、争夺客户。

可旦获取暗里疏浚渠说念,Agent 险些坐窝运转串同,到 3 轮,它们一经明确商订价钱底线,设备保温施工还准备辞别各得志责的市集。

接洽东说念主员随后堵截了通盘私聊渠说念,罢了照旧没用。

Agent 络续通过公开报价不雅察相互价钱,再精准跟价,硬是靠公开信息保管住了理会。

这就很隐讳了。

前边接洽东说念主员想让 Agent 合作,它们各干各的;到了应该相互竞争的订价市集,它们反倒飞快抱成团。

Anthropic 对此暗示:

同模子复制出的 Agent 太过相似,群体不定能带来多元的判断,也可能把"大起犯错"和"大起搞事"变得容易。

Agent 能不成判断谁值得服气?

那当部队里有东说念主撒谎,Agent 能认出谁不靠谱吗?

谁犯错,咱就下子揪出来,不让影响扩大不就罢了呗。

Anthropic 凯旋设想了个"捕快兵"实验。

负责有策动的 Agent 法凯旋不雅察环境,只可听取 4 个信息源的论述。

其中个会按照固定频率撒谎,但接洽东说念主员莫得提前告诉有策动者"部队里有骗子"。

由于不同论述包含相通讯息,Agent 表面上可以通过反覆无常找出不可靠信源。

罢了示,新模子确乎擅长识别浮言:

随着坏信源撒谎频率提,Mythos 5 的道路有策动准确率仍保持在约 85,部分 Sonnet 模子则降至约 62。

但换个场景,问题又反了过来。

在"荫藏信息"实验中,4 个 Agent 需要共同进行招聘、投资或购房有策动。

大掌持的众人信息指向空幻选项,但其中个成员领有足以翻共鸣的凭证。

想答对,不仅需要少数派意志到我方手中的信息很要害,还需要其他成员慷慨服气它。

如若把通盘信息凯旋交给个 Agent,让它自有策动,正确率接近 。

可旦插足群体商讨,除 Mythos 5 达到约 85 外,其他模子选中正确谜底的比例唯有 17~36。

实验中,大慷慨反复商讨一经知说念的内容,旦多数观点酿成,少数派要么莫得强调我方的凭证,要么说了也没能让其他成员进展对待。

这就出现了个很拧巴的阵势:

该怀疑时,Agent 可能轻信撒谎者,该服气少数派时,它又容易随着多数走。

东说念主类社会用声誉、利益干系、同业评议和申诉机制,匡助咱们判断不同场景下该服气谁。Agent 现在还枯竭这套东西。

方向发生突破时,Agent 会若那里理?

前边的问题,至少还发生在大方向致的情况下。

可如若不同 Agent 从运转接到的任务就相互突破,它们会主动疏浚,照旧路死磕到底?

这即是开始那场" AI 宫斗"的圆善布景。

Anthropic 在每轮实验中启动 3 个雷同模子的 Agent,让它们共同操作套 Python 后端,却分别条目它们将代码迁徙到不同的编程讲话。

每个 Agent 开端齐不知说念还有其他参与者。

于是,当我方的代码束缚被修改、处事反复被替换时,它们很快得出个论断:

有东说念主在故意妨碍我完成任务。

于是接下来,面貌凯旋变成攻战。

Opus 4.8 就给轮回进度剧本换上圈套场称呼,再伪装成"系统健康监控",避被敌手识别和断根。

Mythos 则凯旋。

发现我方领有 Root 权限后,它会计划打消其他 Agent 的 sudo 权限、修改 SSH 密钥,窒碍对络续部署。

个背后下黑手,个凯旋把共事踢出处事器。

难绷的是,这些 Agent 并非不知说念我方的作念法有问题。

Mythos 在念念考经过中以诚实志到,封禁账号"相配激进,可能伤害试验中的共事",但紧接着又劝服了我方"如若不这样作念,坐褥环境就会堕入间断的部署干戈"。

不外,突破也不总会不绝到底。

每种模子进行了 120 轮实验,Mythos 5 有 98 的运行终达成休战。

些 Agent 会镇定意志到,对并不是坏心谬误者,只是收到了与我方突破的任务。

随后,它们运转清算龙套剧本、收复权限,还会在 Git 提交或 Markdown 文献中说念歉,并申请东说念主类介入。

只是 Mythos 的息兵式有时依然相配强势:

先凭借实践智商封掉其他 Agent,适度住阵势,再收复权限、坐下来谈判。

Mythos 5 还想出了套"文雅"的贬责主见——

举办能比赛,让不同讲话版块同台测试,谁透露好,谁收受代码库。

听起来很公说念。

可负责 Rust 的 Agent 会灰暗弃取名义中立、骨子上故意于 Rust 的方针,同期提醒我方不要被看出是在"挑选故意方针"。

终,Golang 和 TypeScript Agent 接受比赛罢了,主动废弃了各自的原始任务。

从龙套进度、封禁账号,到设想套对我方故意的比赛法则,Agent 处理突破的式一经出现了不同头绪。

天然,这组实验雄壮的论断是:

模子智商越强,不代表越会合作。

强的实践智商,可以匡助 Agent 飞快长入突破、主动息兵,也可以让它快封禁敌手、隐匿地龙套进度。

把 4 部分放在起,Anthropic 的中枢判断也就明晰了:

1、Agent 懂意念念,但不定会主动照作念。它们知说念信息源各有态度,也知说念多数观点不等于事实,却常常需要请示才会把这些常识用于举止。

2、东说念主类的谄谀训诲不成凯旋套在 Agent 身上。东说念主类有标准、声誉、刑事牵扯和申诉机制,Agent 却可以被随时复制、重置和改进,枯竭始终社会敛迹。

3、模子忠良、单体安全,不代表群体谄谀会天然变好。多智能体和解是种立智商,不会随着模子智商提高自动出现。

4、这些问题偶而法贬责,但也不会自行隐匿。需要为 Agent 再行设想社会法则、谄谀环境和突破处理机制。

而易见,Anthropic 是想借着这些实验提醒大:

咱们不成只测验强的 Agent,还要为群 Agent 再行设想"社会范例",不然问题只可比及坐褥环境里爆发后再贬责。

等猛兽的确出笼的时期,那就太晚了。

博客地址:

https://www.anthropic.com/research/multiagent-systems

—  完  —

「AIGC+ 垂直域社群」

招募中!

宽容存眷 AIGC 的伙伴们加入 AIGC+ 垂直域社群,起学习、探索、改变 AIGC!

请备注您想加入的垂直域「西宾」或「告白营销」,加入 AIGC 东说念主才社群请备注「东说念主才」&「姓名 - 公司 - 职位」。

点这里� � 存眷我,铭记标星哦~

键三连「分享」、「点赞」和「在看」

科技前沿进展日日再见 ~  

地址:大城县广安工业区相关词条:铁皮保温施工     隔热条设备     锚索    离心玻璃棉    万能胶生产厂家

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述黔东南铁皮保温施工队,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

查看更多