mimile
На главную

Учёные из Тюбингена и Snyk извлекли скрытые рассуждения из моделей OpenAI, Anthropic и Google

AI-дайджест

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Учёные из Тюбингена и Snyk извлекли скрытые рассуждения из моделей OpenAI, Anthropic и Google

Специалисты по информатике из Тюбингенского университета и компании Snyk раскрыли метод извлечения скрытых цепочек рассуждений передовых ИИ-моделей, включая модели OpenAI, Anthropic и Google. Метод позволил восстановить пароли и ключи API, но эта уязвимость уже исправлена, и предоставил свидетельства того, что китайские модели, такие как Kimi K3, могли быть обучены через дистилляцию рассуждений американских моделей. Основная уязвимость — раскрытие рассуждений через API — остаётся неустранённой у всех протестированных провайдеров.

Метод извлечения

Учёные из Тюбингенского университета, Института Макса Планка, MATS Research и компании Snyk продемонстрировали, что скрытые цепочки рассуждений — внутренний текст, генерируемый ИИ-моделями при решении задач, — можно восстановить через API. Уязвимость затрагивает передовые модели OpenAI, Anthropic и Google. По словам Александра Панфилова из Тюбингенского университета, все протестированные крупные провайдеры подвержены этой проблеме, что может позволить злоумышленникам масштабно копировать способности моделей к рассуждению.

Признаки дистилляции и утечка данных

Исследователи обнаружили, что ответы китайской модели Kimi K3 от Moonshot AI поразительно совпадают со скрытыми рассуждениями Claude Opus 4.8 и GPT 5.6 Sol на определённых запросах, что указывает на возможную дистилляцию. Авторы подчёркивают, что это не является окончательным доказательством, и схожих совпадений не наблюдалось с DeepSeek или Inkling. Кроме того, метод позволил извлечь личную информацию, такую как пароли и ключи API, из рассуждений моделей, но эта уязвимость уже устранена провайдерами. Ранее OpenAI и Anthropic обвиняли китайские компании в систематической дистилляции.

Что дальше

Исследователи предупреждают, что основная уязвимость извлечения рассуждений остаётся неисправленной, что вызывает опасения относительно защиты интеллектуальной собственности и безопасности развёрнутых моделей. Пока неясно, внедрят ли API-провайдеры структурные изменения для скрытия рассуждений или регулирующие органы вмешаются, чтобы ограничить несанкционированную дистилляцию.

1 источник

Учёные из Тюбингена и Snyk извлекли скрытые рассуждения из моделей OpenAI, Anthropic и Google