GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
аблитерацияuncensoredбезопасностьлокальные-моделиисследования

Расцензуренные LLM самоувереннее обычных — но не точнее

Эксперимент на r/LocalLLaMA показал: аблитерация убирает не только отказы — модели становятся оптимистичнее и увереннее при той же точности предсказаний.

Влад МакаровВлад Макаровпроверил и опубликовал
5 мин чтения
Расцензуренные LLM самоувереннее обычных — но не точнее

Представьте двух аналитиков с одинаково бесполезными прогнозами. Первый говорит: «Сложно сказать, возможно, вырастет, но есть риски». Второй уверенно чеканит: «Вырастет». Угадывают оба с частотой подброшенной монеты — но слушать хочется второго. Примерно это, как выяснилось, делает с языковыми моделями снятие цензуры.

Эксперимент

Автор нашумевшего треда на r/LocalLLaMA прогнал несколько популярных моделей и их «аблитерированные» версии через одну и ту же задачу — предсказания с проверяемым исходом. Сама точность никого не удивила: и базовые, и расцензуренные модели угадывали на уровне монетки, чего от них, собственно, и ждали.

Удивило другое. Аблитерация — техника, которая вычисляет в активациях модели «направление отказа» и вырезает его, чтобы модель перестала отвечать «извините, я не могу», — изменила не только частоту отказов. Изменился характер. Расцензуренные версии давали заметно больше оптимистичных прогнозов «будет расти», реже употребляли слова вроде «возможно» и «неопределённо», а их рассуждения стали длиннее и категоричнее. Уверенность выросла. Точность — нет.

Почему так происходит

Строго говоря, ничего мистического в этом нет. «Направление отказа» в пространстве активаций — не хирургически точный объект. Отказы, осторожность, оговорки и признание неопределённости в обучающих данных ходят рядом: модель, которую учили отказываться от опасных запросов, одновременно учили хеджировать и сомневаться. Вырезая одно, аблитерация задевает и другое. Получается модель, у которой удалили не только цензора, но и внутреннего скептика.

Здесь полезно вспомнить, что «uncensored», «abliterated» и «jailbroken» — три разные вещи, которые часто сваливают в одну кучу. Файнтюн на нецензурированных данных, хирургия активаций и обход защит промптом дают разные артефакты. Но эксперимент добавляет к этой классификации неприятное измерение: у каждого способа снятия ограничений есть своя цена в калибровке, и пользователь её обычно не видит.

Кому это должно быть тревожно

Расцензуренные модели — огромная ниша локального AI: ими пользуются не только ради сомнительного контента, но и потому, что базовые модели отказывают в совершенно легитимных запросах, от медицинских вопросов до анализа вредоносного кода в защитных целях. Тред и собрал сотни апвоутов именно потому, что задел эту аудиторию за живое.

Проблема в том, что уверенный тон — главный канал, по которому человек считывает компетентность собеседника. Модель, которая перестала сомневаться, воспринимается как модель, которая стала умнее, — хотя измеримо она осталась ровно такой же. Для болтовни это безразлично. Для финансовых решений, медицинских вопросов или оценки рисков — это худшая из возможных комбинаций: та же монетка, но с голосом эксперта.

Отсюда простой практический вывод для тех, кто гоняет аблитерированные модели локально: относитесь к их категоричности как к артефакту хирургии, а не к сигналу качества. И если модель внезапно перестала говорить «я не уверена» — это не потому, что она разобралась в вопросе.

Похожие новости

Листайте вниз

для загрузки следующей статьи