Призраки в науке: как ИИ наводняет журналы выдуманными авторами
Фантомы текстов: как нейросети порождают вымышленных авторов и ставят под удар научные архивы
Представьте картину: некие Елена Васильева и Марк Чернов мелькают в роли экспертов по вулканам, космонавтов, героев триллеров, ведущих подкастов и соавторов научных статей. Тысячи документов. Десятки публикаций.
Проблема одна — этих людей никогда не существовало. Ни реальных ученых, ни забытых исторических персонажей. Просто призрачные имена, которые языковые модели генерируют снова и снова.
Исследование (arXiv:2606.02184) раскрыло любопытный побочный эффект бума генеративного ИИ: нейросети обзавелись собственными «предпочтениями» в именах. Определённые выдуманные персонажи всплывают в их ответах подозрительно часто. И речь не о забавном казусе — проблема уже ударила по научным изданиям.
Почему ИИ запоминает именно эти имена
Когда вы просите нейросеть создать эксперта или соавтора статьи, она не выбирает из нейтрального пула. У каждого семейства моделей есть любимчики.
Claude стабильно генерирует пару Елена Васильева и Марк Чернов, иногда добавляя Амара Окофор. GPT предпочитает Элару Восс, но с партнёром определяется нестабильно. Gemini выбирает Ариса Торна и Лену Петрову.
Совпадения не случайны. Исследователи зафиксировали: пары этих имён появляются вместе гораздо чаще статистической нормы. Складывается ощущение, что каждая модель «прочитала» одни и те же вымышленные романы и теперь ставит одних персонажей в разные роли.
Причём предпочтения привязаны к версии модели. Когда разработчик выпускает обновление, любимые призрачные имена часто меняются. Возникают «датируемые следы поведения» — временные метки, позволяющие определить, когда именно был создан контент.
Катастрофа для научных архивов
Вот где становится действительно тревожно. На Zenodo — хранилище CERN с настоящими DOI от DataCite — обнаружили 1655 записей с призрачными авторами. Все публикации приписаны несуществующим журналам, даты сфальсифицированы.
Речь не о подделках, запрятанных в дальний угол интернета. Эти записи получили реальные DOI в системе DataCite. Их забирают агрегаторы: Google Scholar, ResearchGate, академические базы, системы цитирования. Вся инфраструктура, от которой зависят исследователи.
Данные DataCite фиксируют регистрацию на сервере — и она выдаёт злоумышленников. Кто-то намеренно указывал прошлое время публикации. Главная улика: 991 запись зарегистрирована за один месяц. Это не органический рост. Это скоординированная атака на репозиторий.
На ResearchGate призрачные имена формируют синтетические исследовательские группы, собирая «соавторов» из разных семейств моделей. Даты публикаций служат надёжным ориентиром для датировки релизов ИИ — по сути, это временная шкала выхода разных моделей.
Причём здесь разработчики и бизнес
«Я не в академии — мне это неважно» — так?
Во-первых, это индикатор состояния всей системы достоверности. Если научные архивы с их контролем качества можно так легко засорить, что тогда происходит с описаниями товаров, маркетинговыми текстами, новостями и техническими документами? Эпоха, когда «ИИ-контент» был исключением, заканчивается.
Во-вторых, скрытые паттерны ИИ — это практическая ценность. Если вы строите сервисы на генеративном контенте, знание «любимых» имён, фраз и архетипов персонажей помогает создавать системы детекции и контроля качества.
В-третьих, при работе с ИИ нужно учитывать его особенности. На NameOcean мы много думаем о том, как искусственный интеллект меняет веб-разработку и хостинг. Это исследование напоминает: ИИ-инструменты мощные, но не нейтральные. У них есть собственные следы, предубеждения, привычки. Думающим разработчикам нужно понимать эти паттерны.
Проблема инфраструктуры DOI
Самое неприятное открытие — уязвимость самой системы DOI. DOI должны быть основой научных коммуникаций: постоянные, надёжные ссылки на работы. Им доверяют, потому что считается: DOI ведёт к реальному контенту с реальными авторами.
Но текущий механизм не проверяет, соответствует ли регистрация DOI реальным людям, которые реально проводили исследования. Заплатил пошлину, заполнил метаданные — получил DOI. Система доверяет добросовестности регистрантов.
Параллель с доменными именами очевидна. На NameOcean мы знаем: домен — первая линия защиты бренда и доверия. DOI играют ту же роль в науке. Когда доверие подрывается, страдает вся система — как при спуфинге доменов или DNS-атаках.
Что с этим делать
Исследователи предлагают несколько направлений:
Реестры DOI могут ввести проверки, выявляющие подозрительные паттерны — сотни статей из несуществующих журналов, имена авторов с невозможной частотой в несвязанных публикациях.
Разработчики моделей могут отслеживать и аудитировать паттерны генерации имён, снижая «запоминание» определённых комбинаций.
Учёные и издатели могут ввести жёсткую верификацию перед принятием работ, включая подтверждение авторства.
Детекторы могут выявлять призрачный контент по характерным признакам, которые нашли исследователи.
Для разработчиков, работающих с ИИ-контентом, вывод очевиден: относитесь к результатам нейросетей со здоровым скептицизмом. Встраивайте верификацию в рабочие процессы. Не принимайте на веру профессионально выглядящий текст.
Контекст
Исследование — окно в зарождающуюся область AI-криминалистики: изучение следов, которые нейросети оставляют в контенте. По мере того как ИИ-контент становится повсеместным, эти следы важны для сохранения доверия и подлинности.
Для технического сообщества — напоминание: мы в начале пути понимания поведения этих систем в масштабе. Призрачные имена — лишь один пример неожиданных паттернов, возникающих, когда миллионы людей начинают пользоваться одними и теми же инструментами. Сюрпризов впереди будет больше.
Что вы думаете о призрачных авторах? Беспокоит ли вас ИИ-загрязнение научной и цифровой среды?
Вопросы об ИИ-ассистированной разработке или построении надёжного цифрового присутствия? Смотрите решения NameOcean для хостинга в эпоху искусственного интеллекта.