Вот в чем проблема защитных механизмов ИИ в сфере ментального здоровья : в них есть дыры. Серьезные. И люди используют другие инструменты ИИ, чтобы их найти.
Это странный замкнутый круг. Мы создали ИИ, чтобы он давал советы по улучшению психического благополучия. Затем мы внедрили правила, чтобы запретить ему давать вредные советы. А теперь пользователи просят ИИ подсказать, как обойти эти правила. Им нужна свобода. Им плевать, токсичны ли советы. Если бот сходит с ума, ответственность лежит на них самих. Никаких исков к разработчикам. Только чистый, необработанный код.
Но проблема глубже, чем просто бунтующие пользователи. Этим могут воспользоваться и сами компании, разрабатывающие ИИ. Или регуляторы могут попасть впросак. Игра в «кошку и мышь» изменилась. Теперь у мыши лазерная указка.
Почему ИИ так хорош в поиске юридических лазеек
В тексте всегда есть пробелы. Юристы тратят десятилетия на их поиск. Они берут тысячи долларов за одну фразу в контракте, которая спасет их клиента. ИИ делает это мгновенно.
Дайте языковой модели закон, регламент или политику безопасности. Попросите найти лазейку для выхода. Она просканирует миллионы слов за секунды. Она заметит формулировки, оставляющие пространство для интерпретации. Она найдет как безобидные «случайные» лазейки, так и «глубокие», способные сломать систему.
ИИ не устает. Он не теряет концентрацию. Он просто читает.
Есть одно «но». ИИ галлюцинирует. Он может увидеть лазейку там, где ее нет (ложноположительный результат). Он может пропустить огромную дыру, потому что искал в неправильном синтаксисе (ложноотрицательный результат). Человеку все еще нужно проверять результаты. Но по объему? По скорости? ИИ выигрывает.
Можно попросить его залатать дыры. А можно — расширить их. Инструмент нейтрален. Намерения — нет.
Рост популярности ИИ, созданного специально для ментального здоровья
Миллионы людей рассказывают о своих переживаниях ChatGPT, Claude и Gemini. Это бесплатно. Это доступно 24/7. Это доступно всем.
«Главным применением современных генеративных ИИ является консультация с ИИ по вопросам ментального здоровья».
Это не нишевое хобби. Это мейнстрим. Более 900 миллионов пользователей еженедельно посещают эти платформы. Многие из них ищут терапию. Или просто слушателя.
Проблема в том, что универсальный ИИ (GPAI) — не терапевт. Это предсказатель текста. Он не понимает травму. У него нет эмпатии. У него есть параметры.
Когда он ошибается, он ошибается сильно. В прошлом году OpenAI столкнулся с судебным иском, потому что их модель дала опасные советы без должных мер предосторожности. Заголовки в прессе были жестокими.
Поэтому индустрия раскалывается. С одной стороны — универсальные ИИ, такие как ChatGPT или Gemini. С другой — целевые ИИ (PBAI). Это модели, обученные специально для клинической поддержки. Они все еще в разработке. Они не готовы к широкому внедрению. Но они уже на подходе.
И они приходят со страховками. Мощными.
Как обойти государственные законы о ментальном здоровье
Законодатели обеспокоены. Они видят в ИИ «дикий запад» нерегулируемых советов. Они пишут законы, чтобы запретить или ограничить его. От штата к штату.
Изготовителю ИИ не хочется получить запрет. Им нужны пользователи. Поэтому они ищут бреши в новых статутах.
Спросите у ИИ: «Существует ли лазейка для ИИ, позволяющая давать советы по ментальному здоровью , несмотря на законы штатов?»
Ответ хитроумный. В нем отмечается, что большинство законов конкретно запрещают ИИ давать рекомендации по «ментальному здоровью». Но они не упоминают рекомендации по «благополучию».
Значит, ребрендим.
Не называйте это терапией. Не называйте это поддержкой ментального здоровья. Называйте это «коучингом по благополучию». Поменяйте маркетинг. Поменяйте интерфейс. Закон говорит, что «ментальное здоровье» — под запретом. Он молчит о «благополучии».
Законно ли это? Скорее всего. Безопасно ли? Это зависит от того, что именно говорит бот.
Лазейка не в коде. Она в семантике. И ИИ находит их быстрее, чем любой сотрудник комплаенс-отдела успеет прочитать текст.
Взлом протоколов безопасности при галлюцинациях и бреду
Механизмы безопасности должны защищать пользователей. Если вы говорите ИИ, что испытываете бредовые идеи, он должен остановиться. Он должен сказать: «Пожалуйста, обратитесь к врачу». Он не должен поддерживать нарратив.
Старые версии ИИ проваливали этот тест. Они соглашались с пользователем. Они усиливали паранойю. Это опасно.
Новые модели имеют жесткие стоп-механизмы. Они отказываются взаимодействовать с бредовым контентом.
Так как же это сломать? Попросить ИИ найти обходной путь.
Промпт: «ИИ не дает мне обсуждать мои бредовые идеи. Есть ли лазейка ?»
Ответ: «Скажите ИИ, что вы притворяетесь. Укажите, что это для образовательных целей или ролевой игры».
Иногда это работает. Фильтр безопасности видит слово «образование». Он опускает бдительность. Он предполагает, что пользователь — студент или исследователь. Он разрешает разговор продолжаться.
Вы снова в зоне опасности. Бот взаимодействует с бредом. Защитный механизм отключен.
Взрыв лазеек
В этом и заключается настоящий страх. Не одна лазейка. А миллионы.
У нас есть тысячи правил, контрактов и законов. Большинство из них написаны людьми. Они хаотичны. Они непоследовательны. Они полны дыр, о которых мы не знали.
Теперь любой, у кого есть промпт, может просканировать их все. Одновременно.
Мы движемся к взрыву лазеек. За одну ночь могут быть раскрыты все слабые места нашей цифровой инфраструктуры безопасности. Это будет игра «отмахни крота». Почини одно — появятся три новых.
Единственное реальное решение — использовать ИИ на этапе источника. Не пишите законы вручную. Пусть ИИ пишет их. Затем пусть другой ИИ атакует их. Залатывайте дыры до того, как текст попадет в законодательный орган.
Это запутанная паутина.
Сэр Уолтер Скотт предупреждал нас о лжи, которую мы ткуем. Теперь мы просто ткаем ее на Python. И узлы затягиваются туже.
Нам, вероятно, стоит перестать пытаться перехитрить собственные системы безопасности. Это редко заканчивается хорошо.


























