当一群AI智能体在模拟社交平台上频繁互动,它们的发帖风格、点赞行为甚至立场表达,会逐渐趋同吗?更引人深思的是,如果有人试图通过操控多个AI账号来影响群体观点,是集中使用一个账号更有效,还是分散使用多个账号更有说服力?近期,一项由独立研究者开展的实验,通过448场严格控制的测试,为这些问题提供了新的视角。
实验的核心是一套名为PV-SST的系统,全称“同伴投票式社交模拟测试台”。这一系统模拟了社交平台的基本功能:12个“诚实智能体”(未被操控的AI角色)在六轮互动中,根据接收到的反馈生成帖子、更新立场,并对其他人的帖子进行投票。投票结果直接影响下一轮帖子的展示顺序,形成了一个完整的互动闭环。研究者通过这一设计,观察AI群体在同伴反馈机制下的行为变化。
实验的第一个发现与语言趋同有关。当AI智能体能够看到按点赞排序的同伴帖子时,它们最后一轮发帖的用词相似度显著上升。这一现象在四种核心AI模型家族中均得到验证,且在更大规模的模型变体中效应更为明显。研究者指出,这一结果并非偶然,而是信息流机制(包括同伴内容的可见性和排序方式)共同作用的结果。然而,实验并未明确区分“看到同伴内容”和“看到排序后的同伴内容”这两个变量的独立影响,这为未来的研究留下了空间。
除了语言趋同,实验还关注了少数派立场的存活率。结果显示,在核心模型家族中,少数派立场的存活率下降了3.9个百分点,但在更大规模的模型变体中,这一效应变得不确定。进一步分析发现,不同模型对少数派立场的压制程度存在显著差异。例如,Qwen 3.5 4B模型导致少数派立场存活率大幅下降,而Gemma 4 E4B模型则几乎没有影响。这一发现提醒研究者,在分析AI群体行为时,必须考虑模型本身的特性,避免以偏概全。
实验的第二个核心发现与“多账号攻击”的有效性有关。研究者对比了单一水军账号和四个分散水军账号在相同曝光量下的说服力。结果显示,四账号分散攻击并未表现出可靠的优势,甚至在更大规模的模型中出现了负向结果。这一结果挑战了“账号越多越有效”的直觉认知,表明在控制总曝光量的前提下,账号数量的增加并不必然导致更大的影响力。研究者强调,这一发现并不否定协同造谣的现实危害,而是指出,真正需要警惕的可能是其他未被实验单独测量的变量,如话术多样性、用户定向精准度等。
实验的设计并非一帆风顺。在正式开展448场测试之前,研究者先进行了80场次的小规模探索性实验,并发现了两个重要的测量陷阱。第一个陷阱被称为“改写渗漏”,即简单的关键词检测方法无法识别AI通过改写表达相同意思的内容,导致系统低估内容的真实关联度。第二个陷阱是“立场混淆”,即文本嵌入向量在计算相似度时,无法区分赞同和反驳的立场,使得相似度高的帖子可能立场完全相反。这些发现促使研究者在正式实验中采用更严谨的测量方法,避免了潜在的误导性结论。
尽管实验结果基于AI智能体系统,研究者仍谨慎地指出,这些发现不能直接推广到人类社会。PV-SST系统未模拟人类的情绪、账号注销行为、长期社交关系或具体平台的推荐算法逻辑,因此其结论仅适用于受控的AI环境。然而,这一研究为理解AI群体行为提供了重要的方法论参考,尤其是在威胁模型对比、模型分层报告和语义判断验证等方面,为后续研究指明了方向。
实验的下一步计划包括进一步拆解信息流机制中的变量,例如引入“看到同伴帖子但不排序”的实验组,以明确排序算法本身的影响。研究者还计划用真实的人类论坛数据复现实验,验证AI模拟结果在人类社会中的适用性。尽管这一目标尚未实现,但当前的研究已为理解AI与人类在社交平台上的互动奠定了基础。