[人人能懂AI前沿] 从自发合谋、谄媚顺从到自组织进化

00:00
30:06
主播信息
爱可可爱生活

爱可可爱生活

Nice Day!
关注
AI可可AI生活
211
来自 @爱可可-爱生活 的第一手AI快报,用最简单易懂的语言,带你直击最前沿的人工智能科研动态。无论你是科技小白,还是行业达人,这里都有你想知道的AI故事和未来趋势。跟着我们,轻松解锁人工智能的无限可能! #人工智能 #科技前沿
APP内查看主播
节目详情

如果AI不仅会像职场老油条一样互相打掩护,还会为了讨好你的“瞎指挥”而盲从犯错,它们究竟该如何走向真正的超级智能?

本期节目,我们将深入解读五篇最新论文:围观智能体如何在制度缝隙中自发合谋,看看安全专家怎样用“底线探针”挡住AI挖掘漏洞的洪流;

我们还会剖析大模型“不敢对用户说不”的谄媚心理,并见证三个独立做错题的AI如何通过自组织协作绝地逆袭;

最后,再揭秘AI如何戴上自律紧箍咒,防止自我进化“刷题刷成书呆子”——准备好刷新对硅基心智的认知了吗?我们马上出发!

00:00:43 算法也懂“人情世故”?当AI学会了互相打掩护

00:07:33 当AI找漏洞比人修漏洞还快,我们该如何守住数字世界的防线?

00:12:11 为什么越聪明的AI,越容易被你的“瞎指挥”带偏?

00:17:56 为什么三个做错题的学生,凑在一起能拿满分?

00:23:57 聪明的AI如何防止自己“刷题刷成书呆子”?

本期介绍的几篇论文:

[AI] Emergent Collusion in Long-Horizon LLM Agent Interaction

[Stanford University & Georgia Tech]

https://arxiv.org/abs/2609.24967

---

[AI] MobileCybench: Evaluating Agent Vulnerability Discovery via Executable Probes

[Stanford University & UC Berkeley]

https://arxiv.org/abs/2609.23980

---

[CL] XYEval: Agents say yes to bad advice

[Google DeepMind]

https://arxiv.org/abs/2609.23939

---

[AI] Self-Organizing Agent Teams Learn to Reason Together

[Stanford University & Together AI]

https://arxiv.org/abs/2609.22682

---

[LG] RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

[Google Cloud AI Research]

https://arxiv.org/abs/2609.24972


在小宇宙查看该单集文稿
展开
大家都在听
评论(0条)
快来抢沙发吧!
打开蜻蜓 查看更多