Поделиться

«Усредняя данные, снижаем творческое разнообразие»: учёный — о том, как и почему деградируют нейросети

Аватар от · 26.07.2026

Изучив все доступные онлайн-ресурсы и столкнувшись с проблемой ограниченного количества информации, нейронные сети начали использовать собственное сгенерированное содержимое. Это привело к их ухудшению: разнообразие ответов снижается, а «ошибки» становятся всё более частыми. Кандидат технических наук, доцент факультета программной инженерии и компьютерной техники, руководитель программы магистратуры «Проектирование и разработка систем ИИ» Университета ИТМО Александр Кугаевских рассказал эксперту, какие механизмы работы нейросетей вызывают их ухудшение, в каких областях применения ИИ наблюдается снижение эффективности и когда обработанная информация может быть утрачена.«Усредняя данные, снижаем творческое разнообразие»: учёный — о том, как и почему деградируют нейросети

— Развитие ИИ происходит неравномерно — некоторые нейросети деградируют, пока другие вырываются вперёд. Получается, что работоспособность ИИ необходимо постоянно поддерживать? Насколько это сложно?

— Это очень сложная и дорогостоящая задача. В условиях жёсткой конкуренции на рынке все компании — Open AI, Antropic, Google, Alibaba — прилагают значительные усилия для того, чтобы сохранить лидерство. Они предлагают похожие услуги, и аудитория пользователей часто перемещается между продуктами.

— Можно ли считать, что конкуренция стимулирует развитие всей отрасли?

— Безусловно: она значительно ускоряет прогресс. Динамичная среда также привлекает внимание общественности, что способствует росту интереса к возможностям нейросетей.

— Верно ли, что сегодня разработчики уже не могут обучать ИИ на данных из интернета, потому что он заполнился сгенерированным контентом?

— Примерно два года назад появился термин «стена данных»: крупные игроки поняли, что данные в интернете иссякли, и обучать ИИ уже не на чем.

К этому моменту, обучаясь на текстах и других материалах, созданных человеком, ИИ достиг определённого уровня качества. Далее в интернете начало появляться всё больше некачественного сгенерированного контента. Обучение на нём приводит к ухудшению моделей.

ИИ опирается на статистические методы. Он стремится свести данные к нормальному распределению. Большинство данных сосредоточено в центре, а на краях их меньше. Эти крайние области отвечают за творческое разнообразие. Усредняя данные, мы снижаем его. Когда модель обучается на низкокачественных материалах, разнообразие ответов уменьшается. Особенно заметно это в узких областях, где данных изначально немного.

— В каких областях применения ИИ быстрее всего деградирует?

— Ситуация постоянно меняется. Сейчас наиболее сильно страдают две сферы. Первая — медицина, особенно диагностика редких заболеваний, поскольку здесь и так мало данных. Нейросеть выбирает наиболее частые примеры и начинает «предсказывать» результаты, которые могут быть неверными в реальном мире.

Вторая область — маркетинг. С одной стороны, ИИ становится всё лучше, даже заменяя копирайтеров. С другой — уменьшается языковое разнообразие, язык становится более простым, метафоры плоскими. Модели повторяют галлюцинации, и теряются культурные особенности, которые сложно выразить формально.

Есть, напротив, активно развивающиеся сферы: например, системы против мошенничества. Там модель не может деградировать, так как постоянно появляются новые методы, и её необходимо дообучать.

Программирование пока не страдает. В открытых репозиториях количество сгенерированного кода пока небольшое. Для дообучения попадают только качественные данные, и порог насыщения ещё не достигнут.

Однако нейросетям сложно понимать бизнес-постановку задачи, переводить её на язык архитектуры и преобразовывать в код.

— Можно ли обучать модели, исключая низкокачественный контент? И как дальше будет происходить обучение нейросетей, на каких материалах?

— Gemini, ChatGPT и другие модели в базовой настройке могут искать информацию в интернете, поэтому они часто сталкиваются с низкокачественным контентом.

Самый актуальный вопрос — не как скачать всё интернет-пространство, а как фильтровать информацию, сохраняя качество и уменьшая ошибки. Это попытка научить искусственный интеллект критическому анализу с помощью математических методов.

Большие языковые модели имеют такой объём, что для качественных ответов на запросы пользователя такая ёмкость не нужна. Но мы ещё не научились правильно структурировать знания внутри нейросети.

— Не обсуждается ли возможность ограничить использование ИИ или маркировать сгенерированный контент, чтобы нейросети продолжали работать, не деградируя?

— Маркировка ИИ-контента — самая полезная практика. В Европе, США и Китае на законодательном уровне уже приняты такие нормы. В нашей стране обсуждается проект федерального закона.

Ограничивать ИИ бесполезно и даже вредно. Распространение низкокачественного контента приводит к тому, что ручной труд становится ценным — аналогично конвейерному производству и ручной сборке.

— Сохраняется ли проблема искажений ответов из-за «эмпатичности» ИИ, когда нейросети сглаживают углы, берегут самооценку пользователей?

— Да, это масштабное явление. Оно берёт начало из западного культурного кода. Конкуренция играет роль: если модель назовёт пользователя глупым, он уйдёт к конкурентам.

Этические и культурные ограничения влияют на достоверность ответов. Поддакиваний стало меньше, но нейросети всё ещё пропускают даже серьёзные ошибки.

Я регулярно общаюсь с несколькими моделями по темам из области математики, провоцирую их, предлагая нелогичные гипотезы, и они далеко не всегда отвечают, что это неправильно.

— А есть ли пути решения этой проблемы?

— Не в моделях для широкого применения. Однако для специализированных моделей, работающих в закрытых системах компаний, институтов или государственных учреждений, это решается с помощью контекстной инженерии, более точного составления промптов и применения специализированных архитектурных решений. Здесь достоверность важнее, чем комплиментарность.

Я, например, не буду просить нейросеть оценить преступление на предмет этичности. Боюсь, что ИИ может принять это за эксперимент и не увидеть, что я ожидаю позитивной оценки.

— У большинства ИИ-моделей есть тематические «заглушки», которые блокируют поиск нежелательной информации. Как это влияет на общую эффективность моделей?

— Нейросети становятся «глупее», когда их ограничивают этическими или религиозными соображениями. Это ещё сильнее снижает разнообразие их ответов. Мы не ограничиваем, например, использование ядерного синтеза. Результаты — на совести человека.

Представим ситуацию: писатель работает над историческим детективом и хочет достоверно описать злодеяния преступников. Он может использовать библиотечные материалы или обратиться к модели, которая быстро даст историческую справку. С этическими ограничениями модель в такой ситуации откажется отвечать на вопросы про рецепт изготовления яда, которым преступник отравит старого графа.

Модель не учитывает контекст. Классическую живопись с обнажённой натурой ИИ может воспринимать как запрещённый контент, хотя это другое культурное явление.

Это касается и мифологических, и религиозных текстов. ИИ либо категорически отказывается обсуждать неоднозначные темы, либо ведёт разговор на примитивном уровне, без глубокого анализа.

— Есть ли у нейросетей подобие человеческой пассивной и активной памяти, структура хранения данных?

— Механизм очень похожий, но работает иначе. Сегодня большие языковые модели устроены по принципу смеси экспертов. При получении запроса определяется контекст, и подключается нужный эксперт из когорты.

У ИИ есть постоянная память — то, что было заложено при создании и обучении, — и есть рабочая, кратковременная память — история переписки, или окно контекста.

— Есть ли у ИИ пределы обучаемости, по достижении которых данные путаются или стираются?

— Да, это называется проблемой катастрофического забывания. Она чисто математическая. Учёные ищут способы управлять этим процессом.

Сейчас мы не можем удалить данные из нейросети, а иногда их надо отозвать — например, персональные данные, для которых есть соответствующий закон.

До пользователя проблемы с катастрофическим забыванием не доходят: обычно её обнаруживают и решают на этапе проектирования.

— Как правильно составлять промпты, задания для ИИ, чтобы повысить качество ответов? Есть ли универсальные принципы?

— Безусловно, есть. За это отвечает целая область — промпт-инженерия. Но даже она уже считается не самой передовой.

Самое передовое в массовом применении больших языковых моделей — управление контекстом. Нужно дать нейросети дополнительную информацию в запросе и ограничить область поиска, чтобы она не выходила за рамки предметной сферы.

Принципы составления качественных промптов различаются в зависимости от задач и моделей, даже от конкретных версий. В каждой новой версии старые промпты работают не так эффективно.

Раньше считалось, что модели надо задать роль. Сейчас это уже неэффективно. Остаётся максимально чётко и строго формулировать запрос. Поставить задачу: например, порассуждать или дать максимально точный ответ.

— Какие проблемы деградации ИИ решаемы и лишь требуют вложения ресурсов и усилий, а какие фундаментально неразрешимы?

— ИИ — довольно молодая область, поэтому пока неясно, какие проблемы решаемы, а какие — нет. Непонятно, как будет решаться проблема религиозных, этических и прочих ограничений. Но это в большей степени зависит от общества, чем от программистов.

Кстати, в интернете публикуются и нелегальные модели без цензуры. Теоретически они могут работать иначе в социально-гуманитарной сфере. Но их применение — на совести пользователя, вплоть до уголовной ответственности.

— Что в целом ждёт ИИ в ближайшее время?

— Дальнейшее развитие. Пока неясно, будет ли оно линейным или экспоненциальным. Основные лидеры уже определились. Часть проектов стала нишевой, как языковая модель Mistral.

Есть другая интересная проблема: люди настолько привыкают к уровню «интеллекта» этих моделей, что, если одна вырывается вперёд, им ошибочно кажется, что остальные деградировали.

Несмотря на то что ИИ вытесняет некоторые профессии и продолжит это делать, я смотрю на его развитие и перспективы с оптимизмом.