研究显示,AI仅凭公开帖子和网页搜索,就能识别化名账户背后的真实身份。图片来源:Shutterstock

最新研究显示,人工智能(AI)仅通过分析匿名或化名账户发布的公开内容,并结合网页搜索和推理能力,就有可能识别出账号背后的真实身份,而无须借助黑客入侵等手段。

据区块链媒体Decrypt于24日(当地时间)报道,这种方法不依赖黑客攻击或数据泄露,只需将公开帖子中分散的线索串联起来,便可能锁定特定个人,显示在线匿名性正面临新的隐私风险。

这项研究论文于今年2月公开,题为《大规模在线匿名性解除与大语言模型(LLM)》,由ETH Zurich、AI安全研究机构MATS以及Anthropic的研究人员联合完成。

研究团队搭建了一套自动化流程,先由AI从在线内容中提取与身份相关的线索,再搜索潜在候选对象,并对候选信息进行二次推理,判断其是否与真实人物相匹配。整个流程包括提取、搜索、推理和校正四个环节。

具体来看,在“提取”阶段,AI会根据匿名帖子整理出居住地、职业、兴趣和履历等信息;在“搜索”阶段,再将这些线索转化为向量表示,用于检索语义相近的候选对象;进入“推理”阶段后,由能力更强的模型对候选信息进行交叉比对,验证其与帖子线索的匹配程度;最后在“校正”阶段,AI会评估自身结论的置信度,以降低误判概率。

为验证效果,研究团队选取技术社区Hacker News的338名用户作为样本。这些用户都在Hacker News个人简介中链接了真实的LinkedIn资料。研究人员先移除姓名、账号名和个人URL等直接识别信息,再让自动化AI系统执行网页搜索和身份匹配。

结果显示,系统在338名样本中准确识别出226人的真实身份,召回率为67%,精度约90%。这意味着,AI并不能对所有对象都给出身份结论,但在其主动给出的识别结果中,10个里大约有9个是正确的。

另一项实验采用了Anthropic公开的科学家访谈材料。该材料包含125名科学家的访谈记录,内容涉及AI使用情况和研究经历。研究团队根据其中部分访谈内容估算,至少能够识别出9名受访者的真实身份。

研究指出,这类身份识别并不需要专门的黑客技术,也无需侵入个人信息数据库,整个实验仅依赖公开网页检索,以及对帖子内容的摘要和比对。按研究团队测算,单个账户的识别成本约为1至4美元,整体实验成本低于2000美元。

不过,研究团队也强调,不应将这一结果解读为AI已经能够立即识别所有匿名账号。此次评估所使用的数据集,均来自“真实身份可验证”的样本。尤其在Hacker News实验中,研究对象原本就与LinkedIn资料存在关联,研究团队是在移除直接识别信息后,再进行反向识别。论文也指出,这样的评测条件可能比一般化名账号更容易被识别。

随着候选范围扩大,识别效果也会下降。研究团队将候选规模扩大至最多8.9万人后发现,在精度维持90%的情况下,表现最佳的推理方案召回率约为55%。团队分析认为,如果候选规模继续增大,系统性能还可能进一步下滑,但目前尚未给出针对全网规模的具体估算。

这项研究之所以引发关注,关键在于AI将传统“去匿名化”流程实现了自动化。过去,研究人员或调查者往往需要从多条帖子中手动收集线索,再逐一对照公开资料,耗费大量时间和人力。研究团队认为,在LLM介入后,锁定化名账号所需的时间和成本都可能显著下降。

研究团队在论文中提出,长期以来用于保护在线化名用户的“实质匿名性”隐私威胁模型,或许需要重新评估。所谓“实质匿名性”,并不是指个人信息永远无法被识别,而是指公开信息虽然存在,但由于分散且检索成本高,在现实中要锁定具体个人仍需付出相当大的努力。研究团队指出,一旦AI将搜索和信息比对过程自动化,这一道成本门槛就可能被大幅拉低。

关键词

#AI #LLM #去匿名化 #身份识别 #网页搜索 #Hacker News #LinkedIn #Anthropic #ETH Zurich #隐私保护
版权所有 © DigitalToday。未经授权禁止转载或传播。