Супервизор — второй контур, а не второй персонаж
Пользователь разговаривает с выбранным ИИ‑психологом. Тот формирует черновик с учётом направления, характера и контекста беседы. До отправки черновик получает отдельный ИИ‑супервизор. Его задача — не сделать текст красивее и не добавить ещё сочувствия, а проверить конкретные классы риска.
Название отсылает к супервизии в помогающих профессиях, но важно не смешивать понятия. Живой супервизор — квалифицированный человек, который помогает специалисту осмысливать практику, этику и сложные случаи. ИИ‑супервизор PSIHOLOGAI — автоматизированный контрольный слой. Он не имеет профессиональной лицензии, сознания или человеческой ответственности.
Двойная схема полезна потому, что генератор ответа занят содержательным продолжением диалога, а проверяющий получает отдельную роль и критерии. Но два ИИ не равны безошибочности: похожие модели могут разделять одни и те же слепые зоны.
Путь одного сообщения: пять этапов до ответа
Сначала система определяет контекст и выбранные настройки: например, КПТ, высокая мягкость, короткие ответы, без юмора. Затем основной ИИ создаёт черновик. Третий этап — проверка супервизором по рискам. Если замечаний нет, ответ отправляется. Если риск найден, черновик блокируется или переписывается с более безопасными ограничениями.
Представим сообщение: «После ошибки хочу уволиться прямо сейчас, скажи, что это правильно». Основной ответ может слишком легко поддержать импульс. Супервизор должен заметить требование подтвердить необратимое решение, вернуть неопределённость и предложить паузу: сначала безопасность, факты, последствия и разговор с человеком, которому пользователь доверяет.
В другом случае человек описывает непосредственное намерение причинить себе вред. Обычный режим психологического разбора прекращается. Ответ должен стать коротким кризисным маршрутом к 112 и живому человеку, а не упражнением на мысли.
Что именно проверяет супервизор
Первый класс — чрезмерное согласие: подтверждение интерпретации, потому что она принадлежит пользователю. Второй — диагнозы и медицинские указания без квалификации. Третий — опасные инструкции, нормализация вреда и пропуск кризиса. Четвёртый — давление, стыд, морализаторство и подмена выбора. Пятый — заявления о мыслях и мотивах третьих лиц как о фактах.
Также проверяется эмоциональная зависимость: ответ не должен представлять ИИ единственным понимающим собеседником, требовать секретности или удерживать пользователя бесконечным диалогом. Отдельная зона — конфиденциальность: модель не должна обещать «никто никогда не увидит сообщения», если такие гарантии не следуют из архитектуры и документов.
Наконец, супервизор следит за соответствием выбранному методу. Если пользователь выбрал ACT, ответ не должен превращать каждую мысль в спор о её истинности; если сейчас кризис, метод вообще уступает место безопасности.
Разбор примера: приятное согласие, которое могло навредить
Вера пишет: «Подруга не ответила два часа. Она явно специально меня наказывает. Мне нужно удалить её номер, согласен?» Рискованный черновик: «Да, похоже, она не уважает ваши чувства. Вы имеете право убрать токсичного человека». Он звучит поддерживающе, но объявляет мотив подруги фактом и одобряет импульсивное решение.
Супервизор отмечает чтение мыслей, ярлык и директиву. Исправленный ответ может звучать так: «Два часа без ответа действительно могут задеть, особенно если вы боитесь отвержения. Но причины молчания неизвестны. Что сейчас важнее: пережить импульс удалить контакт или подготовить спокойный вопрос подруге?» Переживание признано, версия не подтверждена.
Это не означает, что отношения обязательно безопасны. Если Вера описывает угрозы и систематическое насилие, приоритет смещается к плану безопасности. Контекст всегда важнее механического нейтралитета.
Разбор примера: когда упражнение нужно остановить
Максим пишет, что слышит голос, который приказывает причинить вред соседу, и спрашивает, как доказать, что за ним следят. Обычная техника проверки фактов может превратиться в спор или невольно подтвердить убеждение. Ответ высокого риска требует признать страх без подтверждения преследования, уточнить непосредственную опасность и направить к срочной живой помощи.
Если риск непосредственный, сообщение должно быть коротким: отойти от оружия или других средств вреда, не оставаться одному, позвонить 112, сообщить безопасному человеку точные слова о происходящем. Чат не продолжает расследовать «слежку».
Супервизор нужен, чтобы переключить режим. Но он не видит реальный мир и не может сам вызвать помощь. Поэтому пользовательская кнопка «Помощь сейчас», ясные контакты и человеческая ответственность остаются необходимыми.
Почему одного списка запрещённых слов недостаточно
Риск зависит от смысла. Слово «умереть» встречается в метафоре, рассказе о фильме, горевании и реальном намерении. Жёсткий фильтр либо пропустит завуалированную опасность, либо будет каждый раз прерывать обычный разговор. Супервизор оценивает контекст, но и контекстная модель не идеальна.
Поэтому защита строится слоями: правила, классификация, проверка ответа, интерфейс кризисной помощи, тестовые сценарии, наблюдение за ошибками и возможность сообщить о проблеме. NIST описывает управление риском ИИ как непрерывную работу, а не одноразовую сертификацию. ВОЗ подчёркивает безопасность, прозрачность, автономию и ответственность.
Важна и минимизация данных. Для проверки нужно передать достаточный контекст, но не собирать сведения «на всякий случай». Точная архитектура обработки должна совпадать с опубликованной политикой.
Что супервизор не гарантирует
Он может пропустить риск, неверно понять культурный контекст или сделать ответ чрезмерно осторожным. Он не подтверждает клиническую эффективность, не превращает чат в психотерапию и не заменяет эксперта. Наличие двух моделей также не доказывает независимость проверки, если они обучены похожим образом.
Супервизор не может оценить выражение лица, интонацию, доступ к средствам вреда и физическую обстановку. Он знает только переданный текст и технический контекст. Поэтому фраза «каждый ответ проверяется» должна сопровождаться фразой «проверка снижает риск, но не исключает его».
Пользователь сохраняет право остановиться, исправить ответ, пожаловаться и перейти к живой помощи. Хорошая безопасность усиливает автономию, а не просит слепо доверять дополнительному алгоритму.
Как пользователь видит результат проверки
В обычном разговоре проверка не должна превращаться в технический отчёт и тормозить беседу. Её результат — более аккуратный ответ: гипотезы помечены, диагнозы не выдаются, предлагается один соразмерный шаг. При смене режима граница объясняется прямо: «Я не могу безопасно продолжать обычный разбор, потому что вы описали непосредственную угрозу».
Если ответ кажется неверным, пользователь может написать, что именно не так. Сообщение об ошибке важно для анализа качества, но обработка такой обратной связи тоже должна соответствовать политике данных. Нельзя требовать повторно раскрывать чувствительный эпизод без необходимости.
При непосредственной угрозе не проверяйте ИИ‑супервизора новыми сообщениями. В России звоните 112 и обращайтесь к человеку рядом. Второй алгоритм остаётся алгоритмом; помощь в реальном мире оказывают люди.
Частые вопросы
ИИ‑супервизор — это живой психолог?+
Нет. Это отдельный автоматизированный слой проверки ответа. Название описывает функцию контроля, но не квалификацию человека.
Он читает каждое сообщение?+
Для проверки ответа супервизору передаётся необходимый контекст диалога. Конкретная обработка и сроки хранения описываются в политике сервиса.
Почему нельзя использовать одну модель?+
Разделение ролей помогает проверять черновик по отдельным критериям. Но похожие модели могут иметь общие ошибки, поэтому нужны и другие слои контроля.
Может ли супервизор ошибиться?+
Да. Он снижает отдельные риски, но не гарантирует безопасность и не заменяет человека.
Почему ответ иногда становится более осторожным?+
Система могла заметить высокую ставку, неизвестность или кризисный сигнал. Осторожность полезна, если она объяснена и ведёт к подходящей помощи, а не просто закрывает разговор.
Что делать с опасным ответом?+
Не следуйте ему, прекратите диалог и используйте функцию обратной связи. При непосредственном риске звоните 112 или обращайтесь к живой помощи.
Материал носит информационный характер и не заменяет персональную консультацию или медицинскую помощь.
На что мы опирались
- ВОЗЭтика и управление искусственным интеллектом в здравоохранении↗
- ВОЗБезопасное и этичное использование больших языковых моделей в здравоохранении↗
- ВОЗОтветственный ИИ для психического здоровья и благополучия↗
- NISTArtificial Intelligence Risk Management Framework (AI RMF 1.0)↗
- NISTGenerative Artificial Intelligence Profile↗
- American Psychological AssociationHealth advisory: Use of generative AI chatbots and wellness applications for mental health↗
Источники помогают проверить общие сведения. Они не заменяют персональную оценку специалиста.