论文署名也能"造人"?AI生成的"幽灵作者"正在入侵学术圈

论文署名也能"造人"?AI生成的"幽灵作者"正在入侵学术圈

七月 05, 2026 ai machine learning academic publishing content authenticity digital trust llm research doi ghost names ai forensics

AI造出来的"幽灵作者":学术界正在被污染

你有没有想过,那些出现在论文、博客、播客嘉宾名单里的名字,可能压根就不存在的人?

比如Elena Vasquez和Marcus Chen这两个人。他们既是火山学专家,又是宇航员,还是惊悚小说主角、播客主持人、学术论文合著者。你能在几百份文档里找到他们的名字。

但问题是——这两个人从来没存在过

这是最近一篇研究论文(arXiv:2606.02184)揭露的惊人现象。研究人员发现,AI模型有自己偏爱的"幽灵名字",这些名字在它们的输出里反复出现,而且出现频率高得离谱。

这事听起来像是个有意思的八卦,但它正在造成实实在在的问题——学术期刊、数据库、整个科研信任体系,都被搅得一团糟。

AI模型也有自己的"心头好"

事情是这样的:当你让AI生成一个虚拟专家、播客嘉宾或者论文作者时,它可不是从一堆名字里随机挑的。

每个AI模型家族都有自己的偏好:

  • Claude特别爱用Elena Vasquez和Marcus Chen这对组合,有时候再加上Amara Okafor
  • GPT比较喜欢Elara Voss,但搭档不固定
  • Gemini则偏好Aris Thorne和Lena Petrova

这不是巧合。研究人员发现,这些名字配对出现的概率,远高于随机分布的预期。就好像每个AI都在读同一本小说,然后一遍遍地让同样的角色"出演"不同的角色。

更有意思的是,这种偏好是跟版本走的。Anthropic、 Google、OpenAI这些公司更新模型的时候,幽灵名字的偏好也跟着变。

这就形成了一种"时间戳"——你可以通过一个AI生成的文档用了哪些名字,大致推断出它是什么时候生成的。

学术圈的污染有多严重?

但事情从"有意思"变成了"值得警惕",是因为Zenodo(欧洲核子研究中心运营的学术仓库)被发现了大量污染记录。

研究人员找到了1655条幽灵作者记录,声称发表在不存在的期刊上,日期也是编造的。

更糟糕的是,这些记录拿到了真实的DataCite DOI。DOI是学术界的"身份证",一旦注册成功,就会被Google Scholar、ResearchGate、各种学术数据库抓取。

也就是说,这些假论文已经混进了整个学术检索系统里。

证据还显示存在故意倒填日期的情况。DataCite的服务器时间戳证明了这一点——有人故意让这些内容看起来比实际更早。

最关键的是:这991条记录是在一个月内集中注册的。这显然不是自然增长,是有组织的污染。

研究还发现,幽灵名字甚至出现在ResearchGate上,组成了"合成研究团队",成员来自不同的AI模型家族。出版日期成了一个可靠的"时间代理",可以用来推断各种AI模型的发布时间。

为什么搞技术的人也要关心这事?

你可能会想:"我又不在学术界,这关我什么事?"

好吧,让我告诉你为什么:

第一,这是内容真实性问题的警报。

连学术仓库(按理说标准已经很严了)都能被这样污染,想想你每天刷到的产品描述、营销文案、技术文档会是什么情况。"AI生成"正在从例外变成常态。

第二,AI输出有隐藏规律。

AI模型有自己的偏好——不只是名字,还包括短语、角色设定等等。如果你做的产品依赖AI生成内容,了解这些规律能帮你建立更好的检测和质量管控体系。

第三,用AI工具要留个心眼。

AI很强大,但它不是中立的。它有自己的"指纹",自己的偏见,自己的套路。聪明人得搞清楚这些规律,而不是傻乎乎地拿来就用。

DOI体系的问题

这个研究最让人担忧的一点,是它暴露了DOI体系的设计缺陷。

DOI本应该是学术交流的基石——永久、可靠的链接,指向真实的学术成果。人们信任它,因为它应该指向真人写的真实研究。

但问题是,这套系统没有验证机制。只要你交注册费,填好元数据,就能拿到一个合法的DOI。系统默认注册者是善意的。

这和域名注册有点像。域名往往是品牌身份的第一道防线,DOI则是学术界信任的标志。一旦信任被滥用,整个体系就会动摇——就像域名欺骗或DNS攻击会破坏互联网信任一样。

我们能做什么?

研究人员提了几个方向:

  1. DOI注册机构可以加验证机制——比如检测到某期刊突然冒出几百篇论文、某个作者名字在毫不相关的论文里异常频繁出现,就要报警。

  2. AI开发公司可以追踪和审计自己的名字生成模式——减少模型"记住"特定名字组合的倾向。

  3. 学术机构和出版商可以加强审核——包括作者身份验证。

  4. 开发检测工具——根据研究发现的特征识别幽灵文章。

对于开发者来说,结论很简单:对AI输出保持合理的怀疑,在工作流程里加上验证环节。别以为排版专业、内容像样的东西就一定是真人写的。

写在最后

这项研究让我们看到了一个新兴领域——AI forensics(AI溯源学)。研究的是AI系统怎么留下行为痕迹,这些痕迹怎么被检测和分析。

随着AI生成内容越来越普遍,这些痕迹会变得越来越重要,关乎信任和真实性。

对于整个技术圈来说,这提醒我们:AI时代才刚刚开始,我们对这些系统的行为还知之甚少。幽灵名字只是冰山一角。后面还会有更多意想不到的事情冒出来。

你怎么看这个现象?担心AI生成内容污染学术和数字基础设施吗?评论区聊聊。


想了解AI辅助开发或者怎么在AI时代建立可信的数字形象?可以看看NameOcean的 vibe hosting方案,专为AI时代设计。

Read in other languages:

RU BG EL CS UZ TR SV FI RO PT PL NB NL HU IT FR ES DE DA EN