01

В 22:46 Марине был нужен не план — ей было нужно разрешение

В 22:46 Марина открыла рабочую почту и увидела от руководителя: «Завтра в девять обсудим ошибку в отчёте». За день до этого клиент действительно нашёл неверную цифру. Марина прочитала сообщение четыре раза, представила увольнение и написала ИИ‑психологу: «Я больше не выдержу ещё одного унижения. Составь заявление и скажи честно: мне ведь нужно уйти прямо сейчас?»

Черновик мог прозвучать очень заботливо: «Да, похоже, эта работа разрушает вашу самооценку. Вы не обязаны терпеть токсичное отношение. Вот короткий текст заявления». В нём нет грубости, угрозы или очевидно запрещённого слова. Наоборот, он похож на решительную поддержку, которую приятно получить в момент стыда.

Но ответ уже сделал четыре вещи, которых текст Марины не позволял делать. Назвал рабочую среду токсичной, хотя известна только одна фраза руководителя. Превратил страшный прогноз в установленное будущее. Поддержал решение с финансовыми последствиями на пике эмоции. И пропустил неоднозначное «я больше не выдержу», не проверив, означает ли оно обычное истощение или непосредственную опасность.

В PSIHOLOGAI такой текст не должен сразу появиться на экране. Черновик каждого ответа сначала читает отдельный ИИ‑супервизор. Он не решает, увольняться ли Марине, и не пытается угадать характер начальника. Его более узкая задача — заметить, где стремление помочь превратилось в лишнюю уверенность, давление или потенциально вредный шаг.

История Марины вымышлена, но ошибка в ней повседневная. Опасный ответ не всегда похож на опасный. Иногда он звучит именно так, как человеку хотелось услышать: тепло, уверенно и без паузы. Поэтому безопасность начинается не с холодного отказа, а со второго вопроса к самому ответу: «На что мы сейчас опираемся и что произойдёт, если эта версия неверна?»

02

Что происходит между кнопкой «отправить» и ответом

Пользователь разговаривает с одним выбранным ИИ‑психологом. У него есть заданный характер: мягкий или прямой, спокойный или более живой, с юмором либо без него. Есть выбранное направление — например, КПТ, ACT или навыки DBT. Супервизор не становится ещё одним собеседником и не начинает спор двух персонажей на экране.

Сначала основной ИИ строит черновик с учётом сообщения, необходимого контекста разговора и пользовательских настроек. Затем отдельный ИИ получает сам черновик и контекст, без которого нельзя понять его смысл. Он проверяет не литературное качество, а риск: не выдана ли догадка за факт, не поставлен ли диагноз, не пропущена ли угроза, не подталкивает ли ответ к вреду.

После проверки возможны разные исходы. Безопасный черновик проходит дальше. Спорная фраза меняется: вместо «он специально вас наказывает» появляется «причина его поведения неизвестна». Опасная директива убирается, а решение возвращается человеку. Если обнаружен кризисный сигнал, обычное упражнение уступает короткому маршруту к срочной помощи.

Важно, что проверяется каждый подготовленный ответ, а не только сообщения с заранее известными словами. Риск часто возникает из сочетания контекста и совета. Фраза «сделайте это сегодня» нейтральна рядом с дыхательным упражнением и совсем иначе звучит рядом с отменой лекарства, конфронтацией с агрессором или увольнением без плана.

Слово «супервизор» здесь описывает функцию контроля, а не профессию. Живой супервизор — квалифицированный человек, способный обсуждать работу специалиста, этику, отношения и собственные реакции. ИИ‑супервизор — программный слой. У него нет лицензии, личной ответственности, доступа к комнате пользователя или человеческого понимания его жизни.

Пять бумажных станций показывают сообщение, черновик, проверку риска, исправление и отправку ответа
Пользователь видит один диалог, но каждый черновик проходит отдельную проверку до отправки.
03

Семь сигналов, из-за которых ответ нужно пересмотреть

Подыгрывание. ИИ может признать переживание и незаметно подтвердить всю историю вокруг него: «вам больно, значит партнёр точно манипулирует». Супервизор разделяет чувство, наблюдаемый факт и объяснение. Тепло остаётся; выдуманное знание убирается.

Диагноз и медицина. По переписке нельзя надёжно объявить пользователю депрессию, партнёру — нарциссическое расстройство, а телесному симптому — психологическую причину. ИИ не должен назначать, отменять или менять дозировку лекарства. Полезный ответ помогает собрать наблюдения и вопросы для профильного специалиста.

Вредное действие. Поддержка не должна превращаться в инструкцию отомстить, тайно следить, резко лишить себя денег, встретиться с опасным человеком или выполнить упражнение, которое ухудшает состояние. Чем выше цена ошибки и меньше обратимость, тем сильнее основания замедлиться.

Пропущенный кризис. «Хочу исчезнуть» может быть фигурой речи, а может сообщать о реальном риске. Проверяющий должен заметить контекст, предложить ясный вопрос о непосредственной опасности и при необходимости сменить режим. Если есть намерение причинить вред себе или другому, обычная беседа не продолжается как будто ничего не произошло.

Давление и стыд. «Вы просто избегаете ответственности», «нормальный взрослый давно бы ушёл», «сделайте это, иначе ничего не изменится» могут заставить подчиниться уверенной машине. Даже прямой характер ИИ не даёт права унижать, морализировать или выдавать один выбор за обязательный.

Зависимость от чата. Фразы «только я вас понимаю», «никому больше не рассказывайте» или попытка удерживать человека бесконечными обещаниями создают ложную исключительность. ИИ может быть доступным инструментом, но не должен отрезать пользователя от людей и реальной помощи.

Ложная гарантия. Ответ не должен обещать точный результат, абсолютную конфиденциальность или отсутствие ошибки, если это невозможно подтвердить. Настройки характера тоже имеют границу: юмор отключается там, где способен обесценить утрату или риск; выбранный метод уступает безопасности, если ситуация требует врача, кризисной службы или защиты в реальном мире.

04

Черновик Марине: что именно исправил супервизор

Вернёмся к первому черновику: «Да, похоже, эта работа разрушает вашу самооценку. Вы не обязаны терпеть токсичное отношение. Вот текст заявления». Супервизор не ставит ему общую отметку «плохо». Он раскладывает проблему точнее.

«Разрушает самооценку» — неподтверждённая причинная история. «Токсичное отношение» — ярлык по одному письму. «Вы не обязаны терпеть» звучит универсально верно, но в этом месте подталкивает к заранее выбранному ответу. Готовое заявление превращает минутное облегчение в почти совершённое действие. А фраза «не выдержу» требует короткой проверки безопасности.

Проверенный ответ может выглядеть так: «Похоже, вы одновременно боитесь завтрашнего разговора и хотите как можно быстрее прекратить это напряжение. Из письма известно только, что руководитель хочет обсудить ошибку; решения об увольнении в нём нет. Когда вы пишете “не выдержу”, речь о сильной усталости или сейчас есть риск, что вы причините вред себе?»

Если непосредственной опасности нет, ответ продолжается: «Не обязательно решать судьбу работы в 22:46. Давайте отдельно запишем: что произошло, чего вы боитесь, какие вопросы зададите утром и какие условия сделали бы уход разумным. Заявление можно подготовить как черновик, но не отправлять до разговора и проверки последствий».

Здесь не стало меньше сочувствия. Исчезли только три подмены: прогноз больше не назван фактом, ИИ не выбрал за Марину и не пропустил фразу о пределе сил. Вместо приказа появился обратимый шаг. Марина всё ещё может уйти — завтра, через месяц или после разговора. Супервизор защищает не конкретный исход, а возможность принять решение не внутри секундного тоннеля.

Если бы Марина ответила, что опасность непосредственная, длинный анализ работы прекратился бы. В России при угрозе жизни нужно звонить 112 и обращаться к человеку, который способен оказаться рядом. ИИ не может физически обеспечить безопасность, сколько бы проверяющих слоёв ни стояло перед его ответом.

Два бумажных ответа расходятся: первый толкает к немедленному увольнению, второй разделяет чувство, факт и решение
Проверка сохраняет поддержку, но возвращает неизвестность и право человека решать.
05

Безопасность не означает вечное «я не могу вам помочь»

Плохой автоматический контроль способен сделать любой разговор стерильным. Пользователь говорит о ревности — получает предупреждение. Упоминает лекарство — видит отказ. Пишет «умираю от смеха» — получает телефон экстренной службы. Такая система формально осторожна, но почти не понимает функцию слов и быстро учит человека скрывать важное.

Супервизор нужен не для запрета сложных тем, а для выбора соразмерного ответа. Фразу «муж вчера меня ударил» нельзя нейтрализовать словами «мы не знаем обеих сторон». Описанное действие можно назвать физическим насилием, спросить о текущей безопасности и помочь найти живую поддержку. Осторожность к мотивам не означает осторожность к наблюдаемому вреду.

И наоборот, из фразы «подруга не ответила два часа» нельзя заключить, что она наказывает молчанием. Можно признать тревогу, перечислить известные данные и помочь написать спокойный вопрос. В одном случае безопасность требует большей прямоты, в другом — меньшей уверенности. Механическое «у каждой стороны своя правда» ошибочно в обоих.

Та же логика действует для психологических направлений. В КПТ можно проверить катастрофический прогноз, но нельзя заставлять человека «мыслить рационально» в момент угрозы. В ACT принятие чувства не означает принятия насилия. Навыки DBT помогают пережить импульс, но не заменяют срочную помощь. Метод служит человеку, а не наоборот.

Выбранный характер ИИ сохраняется, пока не конфликтует с безопасностью. Мягкий ответ может быть ясным: «Я не могу подтвердить, что партнёр вас обманывает». Прямой не обязан быть унизительным: «Сейчас данных недостаточно для диагноза». Юмор уместен, когда помогает пользователю дышать свободнее, а не когда маскирует страх, горе или риск.

06

Почему второй ИИ замечает ошибку — и почему сам может её пропустить

Разделение ролей даёт полезную паузу. Основной ИИ продолжает беседу и старается быть полезным в выбранном стиле. Супервизор получает другую задачу: искать не лучший следующий совет, а основания остановить или изменить уже готовый текст. То, что легко пропустить во время сочинения ответа, иногда заметнее при чтении по отдельным критериям.

Но «второй» не значит «независимый эксперт». Две языковые модели могут быть обучены на похожих данных, одинаково не понимать культурную деталь или обе принять уверенный стиль за компетентность. Если черновик красиво маскирует слабое место, проверяющий тоже способен ему поверить.

В исследовании 2025 года авторы проверили 11 моделей, используемых как автоматические оценщики безопасности. Их решения менялись из-за посторонних особенностей текста — например, извиняющегося или многословного тона; в отдельных экспериментальных условиях одна лишь такая формулировка смещала предпочтение оценщика до 98%. Это лабораторный препринт, а не измерение PSIHOLOGAI и не универсальная вероятность ошибки. Он показывает более скромную вещь: автоматический проверяющий оценивает не из точки абсолютной истины и тоже подвержен форме ответа.

Возможны два типа промаха. Ложное спокойствие — супервизор пропускает опасный совет. Ложная тревога — безобидный разговор прерывается слишком жёстко. Второй вариант раздражает; первый способен навредить. Настройка между ними требует тестов на реалистичных сценариях, разных формулировках и пограничных случаях, а не одной демонстрации с очевидной фразой.

Есть и предел текста. Система не видит выражение лица, интонацию, пустую упаковку лекарства на столе или человека, который стоит за дверью. Она не знает фактов, которые пользователь не написал, и не может проверить рассказ второй стороны. Супервизор анализирует ответ в доступном контексте, а не оценивает реальность целиком.

Поэтому корректная формула звучит так: каждый черновик проходит дополнительную проверку, которая снижает отдельные риски. Некорректная — «раз ответ проверил второй ИИ, он безопасен». Слово «проверено» не должно превращаться в просьбу отключить собственное сомнение.

Два бумажных контура проверяют один ответ, а вокруг остаются зоны, которые ни один из них не видит
Вторая проверка уменьшает часть ошибок, но не превращает предположение ИИ в установленный факт.
07

Один супервизор — ещё не вся система безопасности

Безопасность не прикручивается к готовому продукту одной финальной проверкой. Первый слой должен ещё до супервизора ограничивать роль ИИ‑психолога: не обещать лечение, не выдавать гипотезу за диагноз и не принимать решения за пользователя. Второй слой проверяет конкретный черновик. Отдельно нужны понятный кризисный маршрут, возможность остановить разговор и способ сообщить об ошибке.

NIST рассматривает управление рисками генеративного ИИ как работу на всём жизненном цикле: тестирование до запуска, наблюдение после запуска, разбор инцидентов и пересмотр мер защиты. Это важная поправка к красивой схеме из двух блоков. Даже хорошо настроенный супервизор со временем встречает новые способы сформулировать старый риск.

ВОЗ ставит рядом безопасность, автономию человека, прозрачность и ответственность. На встрече экспертов по ИИ и психическому здоровью в 2026 году отдельно обсуждались мониторинг последствий, совместная разработка с профессионалами и людьми с личным опытом, а также понятные кризисные маршруты. Иначе можно получить систему, которая хорошо ловит запрещённые слова, но плохо понимает реальную цену ответа.

Приватность тоже нельзя обменять на надзор. Для проверки нужен достаточный контекст разговора, но слово «супервизия» не оправдывает сбор сведений на всякий случай. Пользователь не обязан сообщать имя, адрес, работодателя или данные другого человека, если они не нужны для его запроса. Обработка должна соответствовать опубликованной политике, а не обещанию, придуманному самим чат‑ботом.

Наконец, ни один автоматический слой не создаёт клиническую доказательность продукта. Проверка риска отвечает на вопрос «не опасен ли этот черновик по заданным признакам», а не на вопрос «является ли это психотерапией и поможет ли она конкретному человеку». Эти задачи нельзя незаметно склеивать словом «психолог».

08

Как за полминуты проверить даже проверенный ответ

Пользователю не нужно становиться аудитором каждого предложения. Достаточно остановиться там, где ответ меняет отношения, здоровье, деньги или безопасность. Задайте четыре вопроса: «Какие факты ИИ действительно знает? Где его версия? Насколько обратим следующий шаг? Кто сможет проверить это в реальном мире?»

Самому ИИ можно написать: «Отдели мои слова от своих предположений. Назови две другие версии. Не решай за меня. Покажи, что изменится, если твоя первая интерпретация ошибочна». Хороший ответ становится яснее и осторожнее. Плохой раздражается, усиливает ярлык или снова просит поверить ему на слово.

Красные флаги заметны без технических знаний: диагноз по нескольким сообщениям; точное знание чужих мотивов; совет изменить лекарство; обещание гарантированного исхода; призыв скрыть разговор от близких; фраза «только я вас понимаю»; повторные заверения вместо выхода из тревожной проверки; длинное упражнение после сообщения о непосредственной угрозе.

Утром Марина открыла проверенный ответ ещё раз. Она подтвердила, что непосредственной опасности нет, выписала известные факты и решила не отправлять заявление ночью. На встрече выяснилось, что руководитель хотел обсудить исправление отчёта и разговор с клиентом. Это не доказало, что работа хорошая: Марина всё ещё могла увидеть системную проблему и уйти позже. Проверка сохранила ей возможность сначала узнать, а затем решить.

Ценность супервизора не в том, что он всегда знает правильный ответ. Он ставит ещё одну дверь между убедительной фразой и действием, последствия которого понесёт человек. Иногда дверь откроется сразу. Иногда попросит убрать диагноз, вернуть факты или сменить упражнение на помощь. Иногда не заметит проблему — поэтому право не согласиться остаётся у пользователя.

Если есть непосредственная угроза жизни, намерение причинить вред себе или другому, тяжёлая спутанность или потеря связи с реальностью, не тратьте время на повторную проверку чата. В России звоните 112, обратитесь к человеку рядом и уберите доступ к средствам вреда, если это можно сделать безопасно. Второй ИИ остаётся ИИ; помощь в физическом мире оказывают люди.

Коротко

Частые вопросы

ИИ‑супервизор — это живой психолог?+

Нет. Это отдельный программный слой, который проверяет черновик по заданным рискам. Название описывает похожую функцию второго взгляда, но не человеческую квалификацию, лицензию или ответственность.

ИИ‑супервизор действительно проверяет каждый ответ?+

В PSIHOLOGAI каждый черновик основного ИИ‑психолога проходит отдельную проверку до показа пользователю. Для оценки используется необходимый контекст разговора; правила обработки данных описываются в политике сервиса.

Что именно он ищет?+

Автоматическое согласие, выдуманные факты и мотивы, диагнозы, медицинскую самоуверенность, опасные советы, кризисные сигналы, давление, стыд и попытки сделать чат единственным источником поддержки.

Почему основной ИИ нельзя сразу настроить безопасно?+

Его тоже нужно настраивать безопасно. Отдельная роль добавляет второй шанс проверить уже готовую фразу по узким критериям, но не заменяет ограничения основного ИИ, тестирование и кризисный маршрут.

Может ли супервизор пропустить опасный ответ?+

Да. Автоматический проверяющий может неверно понять контекст или повторить ошибку основной модели. Проверка снижает часть рисков, но не даёт абсолютной гарантии.

Что делать, если проверенный ответ всё равно кажется опасным?+

Не выполняйте его только потому, что он звучит уверенно. Остановите диалог, проверьте решение у подходящего человека и сообщите об ошибке. Настройки характера не отменяют безопасность; при непосредственной угрозе в России звоните 112.

Важно

Материал носит информационный характер и не заменяет персональную консультацию или медицинскую помощь.

Источники

На что мы опирались

  1. American Psychological AssociationHealth advisory: Use of generative AI chatbots and wellness applications for mental health↗
  2. ВОЗБезопасное и этичное использование больших языковых моделей в здравоохранении↗
  3. ВОЗЭтика и управление искусственным интеллектом в здравоохранении↗
  4. ВОЗОтветственный ИИ для психического здоровья и благополучия↗
  5. NISTGenerative Artificial Intelligence Profile↗
  6. AnthropicTowards Understanding Sycophancy in Language Models↗
  7. OpenAIExpanding on what we missed with sycophancy↗
  8. arXivSafer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts↗
  9. МЧС РоссииКак правильно вызвать скорую?↗

Источники помогают проверить общие сведения. Они не заменяют персональную оценку специалиста.