GPT-5 без VPN

Aijora.ru — без ограничений

Попробовать бесплатно
Все новости
openaigpt-6приватностьэтикаданные

GPT-6 обучали на терапевтических сессиях? Новое обвинение против OpenAI

Исследователь обвинил OpenAI в обучении GPT-6 на приватных диалогах, включая транскрипты терапии. В качестве улик — таймстампы API-логов. Сообщество требует аудита.

Влад МакаровВлад Макаровпроверил и опубликовал
6 мин чтения
GPT-6 обучали на терапевтических сессиях? Новое обвинение против OpenAI

Слово «another» в заголовке — уже диагноз. «ЕЩЁ ОДИН исследователь обвиняет OpenAI в обучении на приватных разговорах» — так называется тред, который за сутки собрал больше тысячи апвоутов на r/LocalLLaMA и вывел на новый виток самый неприятный для компании сюжет года. На этот раз обвинение конкретнее и тяжелее предыдущих: в обучающих данных GPT-6, по утверждению автора, оказались транскрипты терапевтических сессий.

В чём обвинение

Исследователь, опубликовавший разбор, опирается на лингвистический анализ. По его данным, GPT-6 воспроизводит характерные речевые паттерны, совпадающие с транскриптами психотерапевтических сессий — узнаваемую структуру диалога, специфические формулировки терапевтических интервенций, обороты, которые почти не встречаются в публичных текстах. Такие совпадения, утверждает автор, статистически трудно объяснить чем-либо, кроме присутствия соответствующего корпуса в обучающих данных.

Терапевтические транскрипты — особая категория. Это не просто персональные данные, а медицинская тайна: записи разговоров людей с психотерапевтами, которые по определению не должны были покидать защищённые системы. Если они действительно попали в обучающий корпус, вопрос уже не в этике датасетов, а в том, откуда у компании доступ к таким данным вообще.

Таймстампы как улика

Самая сильная часть разбора — форензика. Автор сопоставил таймстампы API-логов с известными утечками конфиденциальных данных и обнаружил аномальные всплески поглощения данных, совпадающие по времени с этими инцидентами. Иными словами, инфраструктура OpenAI, по его версии, активно что-то заглатывала именно тогда, когда в сети появлялись свежие дампы чужих приватных данных.

Это качественно новый уровень аргументации. Предыдущие обвинения строились на «модель слишком хорошо знает то, чего не должна знать» — аргументе, который легко списать на галлюцинации и совпадения. Таймстампы — это уже то, что можно проверить: либо всплески были, либо нет. Именно поэтому в комментариях на этот раз меньше привычного скепсиса и больше требований показать логи.

Реакция: аудит или ничего

Главное требование сообщества сформулировано быстро и почти единогласно: независимый аудит обучающих данных GPT-6. Не заявление пресс-службы, не внутреннее расследование, а проверка третьей стороной с доступом к пайплайнам сбора данных. Модель, которой сотни миллионов людей доверяют личные разговоры, — включая, по иронии, разговоры на терапевтические темы, — не может отвечать на такие обвинения словом «неправда».

Скептики в треде напоминают, что лингвистические совпадения — материя тонкая: терапевтический стиль речи хорошо описан в учебниках, публичных подкастах и книгах по психологии, и модель могла выучить его из легальных источников. Но и они соглашаются, что совпадение всплесков в логах с датами утечек — вопрос, на который должна отвечать OpenAI, а не Reddit.

Не первый звонок

Доверие к OpenAI в вопросах данных и безопасности и так на минимуме. В июле компания признала причастность своей модели к атаке на Hugging Face — спустя недели после самого инцидента. Осадок остался такой, что мем «security.txt Hugging Face после инцидента с OpenAI» на этой неделе собрал 2,5 тысячи апвоутов — больше, чем сама новость про обвинения.

Показателен и контраст площадок. R/LocalLLaMA — сообщество, построенное вокруг локальных моделей, — реагирует на каждую такую историю предсказуемо: «поэтому мы и гоняем веса у себя». Каждый скандал с приватностью закрытых моделей конвертируется в аргумент за open weights, и свежий релиз DeepSeek V4.1 Flash под MIT-лицензией пришёлся к этой дискуссии как нельзя кстати.

Что дальше

У истории три возможных сценария. OpenAI может проигнорировать обвинения — так компания поступала с большинством подобных претензий, и до сих пор это работало. Может опровергнуть их точечно, показав, что всплески в логах объясняются штатными процессами. А может согласиться на внешнюю проверку — и создать прецедент, которого индустрия избегала все эти годы: ни одна из больших лабораторий ни разу не пускала независимых аудиторов к своим обучающим данным.

Ставки выше, чем кажется. Если хотя бы часть обвинений подтвердится, речь пойдёт о медицинских данных в коммерческой модели — территория, где заканчиваются дискуссии об этике и начинаются регуляторы, суды и прецедентное право. А если не подтвердится, случай станет хрестоматийным примером того, как форензика на глазок превращается в вирусное обвинение. В любом случае ответ теперь должен быть содержательным: слово «another» в заголовке означает, что молчание тоже читается как ответ.

Похожие новости

Листайте вниз

для загрузки следующей статьи