NeurIPS 2026
世界偶尔回应我
“你不能只为自己而活;千万条丝线将你与你的同胞连接在一起,而沿着那些丝线,如同沿着共振的弦一般,你的行为会作为原因向外传递,又将造成结果返回到你自己身上。”
这篇文章研究声誉(Reputation)问题,是一个多人通信问题,每个人可以评价别人的行为,每个人在和另一个人互动的时候也都可以看到别人对它的评价。方法是纯RL,我们的方法可以让一个从0开始学习的 Agent 学会如何在一个社会评价体系里存活(在他人的凝视下behave itself),并学会如何通过闲谈评价别人的行为来改变整个社会风气使其对自己有利。潜在的未来应用场景包括涉及通信的社会群体系统的建模,比如电商平台和数字零工系统(如网约车平台)里面的评论系统。
这个问题的难点在于延迟奖励和信号影响力的归因。当每个人的行为都会被别人评价的时候,玩家在做任何动作时都要考虑自己对他人的影响 以及这个影响以后又将会如何影响回自己。个体A该如何行动 来改变B的看法 从而使C在之前从没见过A的情况下愿意和A自己合作?A又该如何评价别人的行为 来操纵整个群体的声誉 从而使自己以后可以获得更多收益?“众生随业流转。” 我们希望设计算法捕捉到这种交互过程中的错综复杂的 业力 Karma,从而稳定地优化收益期望。我们把这种跨Agent 的 Credit Assignment 问题称为 Influence Attribution,即,研究玩家该如何完成这一条链的归因:如何提高自己的收益 -> 谁的行为影响了我的收益 -> 如何改变自己的动作来改变那些人对我的评价/如何改变自己对别人的评价来改变群体的风气使其对我有利。
没有 Reward Shaping,没有 Centralized Mechanisms,没有在方法里引入任何关于 Reputation 的先验知识,我们给出的答案是简单自然的,自然到能让人感觉这问题本就应该这样解决:梯度。把动作也看成是一种信号,那么我的信号的细微变化会引起你的行为的什么变动这个问题,就被归约成咱的老问题 通信问题了,直观上可以说动作也是在表达你的倾向所以也是通信。在这个环境的随机过程里,我们重新推导了 Policy Gradient,计算每个 sampled trajectory 里的自己最后的收益期望对自己策略的梯度,中间沿着整个计算图 chain through 了的所有的策略函数,也就是沿着这整个互动历史构成的网络拓扑来计算了“个体的行为对自己未来收益的途径过程中的每个人造成的影响”,可以说Influence Attribution 是自动完成的。实验效果是在经典Leading Eights和新造的群体里都达到了理论上的最优均衡。
不是花费最多心血的一篇但算是很有纪念意义的一篇了,这是当时吸引我加入这个研究方向的问题之一。组里之前做过一些尝试但是探索比较曲折所以一直被搁置。一直以来有隐隐感觉这个问题也许可以用之前的一些简单的insights来搞,不过一直没有真的去起步。在经历诸多其他稿子的不顺(有不可抗力也有自身原因)之后,终于在今年2月底决定捡起来开始着手推进。折腾了2个月做了尽可能足的准备,直接投直接中,稳得像失去过什么。在这个技术日新月异的大模型时代,做出一篇古典的强化学习算法已经不算是什么能称道的事了,但这篇解决了不光是一个问题也解决了心结,作为又一个个人阶段性的工作我仍然感到很满意,也是感性地写了这许多。于是今晚可以不再琢磨 multi-agent system 的春天到底什么时候来,喃喃着什么 “一切烦恼都来自于人际关系”、“以特定方式把 agents 组织成社会才会产生真正的智能”、”more is different” 就睡着了
感谢导师们的指导,感谢合作者及身边人的支持。孩子终于又要到饭了🍌🐒

