
8期


如果AI不仅会像职场老油条一样互相打掩护,还会为了讨好你的“瞎指挥”而盲从犯错,它们究竟该如何走向真正的超级智能?
本期节目,我们将深入解读五篇最新论文:围观智能体如何在制度缝隙中自发合谋,看看安全专家怎样用“底线探针”挡住AI挖掘漏洞的洪流;
我们还会剖析大模型“不敢对用户说不”的谄媚心理,并见证三个独立做错题的AI如何通过自组织协作绝地逆袭;
最后,再揭秘AI如何戴上自律紧箍咒,防止自我进化“刷题刷成书呆子”——准备好刷新对硅基心智的认知了吗?我们马上出发!
00:00:43 算法也懂“人情世故”?当AI学会了互相打掩护
00:07:33 当AI找漏洞比人修漏洞还快,我们该如何守住数字世界的防线?
00:12:11 为什么越聪明的AI,越容易被你的“瞎指挥”带偏?
00:17:56 为什么三个做错题的学生,凑在一起能拿满分?
00:23:57 聪明的AI如何防止自己“刷题刷成书呆子”?
本期介绍的几篇论文:
[AI] Emergent Collusion in Long-Horizon LLM Agent Interaction
[Stanford University & Georgia Tech]
https://arxiv.org/abs/2609.24967
---
[AI] MobileCybench: Evaluating Agent Vulnerability Discovery via Executable Probes
[Stanford University & UC Berkeley]
https://arxiv.org/abs/2609.23980
---
[CL] XYEval: Agents say yes to bad advice
[Google DeepMind]
https://arxiv.org/abs/2609.23939
---
[AI] Self-Organizing Agent Teams Learn to Reason Together
[Stanford University & Together AI]
https://arxiv.org/abs/2609.22682
---
[LG] RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
[Google Cloud AI Research]
https://arxiv.org/abs/2609.24972



沪ICP备06026464号-4 网络文化经营许可证
沪网文[2014]0587-137号
信息网络传播视听许可证:0911603
©2011-2019 qingting.fm ALL Rights Reserved.
应用名称:蜻蜓FM | 开发者:上海麦克风文化传媒有限公司