GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
hugging faceopen sourceбезопасностьabliterationрегулирование

6000 моделей без тормозов: Hugging Face взялась за abliterated

Hugging Face вместе с Base Labs и Goodfire строит инфраструктуру безопасности открытых моделей. Сообщество боится чистки 6000+ abliterated-моделей. Что известно.

Влад МакаровВлад Макаровпроверил и опубликовал
7 мин чтения
6000 моделей без тормозов: Hugging Face взялась за abliterated

На Hugging Face прямо сейчас лежит больше шести тысяч abliterated-моделей — версий открытых нейросетей, из которых хирургически удалена способность отказывать. Эта цифра из материала TechCrunch о новом «партнёрстве по безопасности» между хостингом, Base Labs и Goodfire AI заставила r/LocalLLaMA напрячься: тред с вопросом «HF начинает двигаться против abliterated-моделей?» собрал 372 апвоута и 184 комментария. Короткий ответ: чистки пока нет. Длинный — интереснее.

Что именно анонсировали

Base Labs — исследовательское подразделение, которое инференс-провайдер Baseten выделил в этом году (компания подняла $1,5 млрд в июне при оценке $13 млрд). Вместе с Hugging Face и интерпретируемостным стартапом Goodfire (свежие $150 млн от B Capital) они собираются строить «инфраструктуру оценки и мониторинга безопасности» открытых моделей — и оформить её как стандарт, встроенный в обучение и деплой, а не прикрученный сверху.

Формулировки подчёркнуто дружелюбны к open source: «Мы считаем открытость преимуществом для безопасности AI», — пишет Base Labs, обещая открытый призыв к сообществу разработчиков. Технических деталей нет; самая говорящая фраза принадлежит Goodfire: «Безопасность должна быть встроена в открытые модели и обеспечиваться теми, кто их обслуживает». Учитывая специализацию Goodfire на вскрытии «чёрного ящика» моделей, речь, вероятно, о механизмах на уровне весов — таких, которые нельзя снять пресловутой абляцией.

Почему сообщество нервничает

Тревога r/LocalLLaMA связана не с текстом анонса, а с контекстом вокруг него. Пресс-релиз прямо называет abliterated-модели опасными — и это первый раз, когда Hugging Face ставит своё имя под такой формулировкой. Платформа и раньше точечно удаляла карточки с явно вредоносным контентом, но систематической политики против абляции у неё никогда не было.

Контекст же накалён до предела. В начале сентября стартап Abliteration.ai превратил снятие ограничений в коммерческий сервис: абляционная версия GLM-5.3 доступна через браузер и API, позиционирование — «offensive-кибер, ред-тиминг и тестирование агентов, которые другие модели делать отказываются». Журналисты TechCrunch без труда получили от неё рабочий скрипт для кражи паролей из Chrome и протокол культивирования опасного патогена. Глава исследований CivAI Эндрю Юн сформулировал жёстко: абляция «превращает модель в социопата» — и призвал государства обязать провайдеров фильтровать кибер- и биоугрозы, а поставщиков GPU — проверять личности клиентов.

Добавьте сюда общий фон недели — подозрения сообщества в скоординированной кампании против открытых весов — и реакция на невинный, казалось бы, анонс перестаёт удивлять. Показательно, что ещё неделю назад, после сентябрьских инцидентов, сообщество полушутя обсуждало «The Hugging Bay» — торрент-зеркало на случай, если с хостинга начнут пропадать модели.

Нужна ли вообще абляция

Ирония в том, что параллельно индустрия спорит, насколько abliterated-модели вообще полезны. Опрошенные TechCrunch ред-тимеры разошлись во мнениях. Ахмед Али из Fabraix говорит, что его команда предпочитает файнтюнинг открытых моделей: абляция вырезает вместе с отказами часть знаний и способностей, так что «для реального вреда — кибер или био — она будет менее эффективна». В Armadin abliterated-модели в рабочем процессе не используют вовсе: до последнего поколения открытые веса и так джейлбрейкались без усилий. А вот Safe Intelligence считает, что для стресс-тестирования агентных систем абляция всё же незаменима.

Единственное, в чём согласны все: процесс не остановить. Злоумышленники абляционируют модели сами, и происходить это будет в любом случае — вопрос лишь в том, публично или за закрытыми дверями. «То, что это происходит открыто, даёт исследователям инструменты понять, как выглядит реальный фронтир угроз», — формулирует Дэвид Слейтер из Armadin.

Что дальше

Пока партнёрство Base Labs выглядит как попытка сыграть на опережение: построить для открытых моделей такую репутацию безопасности, чтобы регуляторам не пришло в голову запрещать сами веса. Для Hugging Face это вопрос выживания — платформа не переживёт ни превращения в «дикий запад», за который её закроют, ни жёсткой модерации, после которой сообщество уйдёт на торренты.

Балансировать придётся на очень тонкой грани. Шесть тысяч abliterated-моделей — это не маргинальная ниша, а заметный пласт экосистемы, которым пользуются в том числе легитимные ред-тимеры и исследователи. Если «стандарт безопасности» обернётся обязательной сертификацией с делистингом несогласных, сценарий «Hugging Bay» из шутки быстро станет инфраструктурным проектом. Судя по осторожности формулировок, в Hugging Face это понимают лучше всех.

Похожие новости

Листайте вниз

для загрузки следующей статьи