← Блог Новости

ИИ вместо психолога: OpenAI впервые измерила, насколько модели справляются

· · 5 минут чтения
Фигура человека рядом с большим речевым облачком и планшетом с галочками

Коротко. 23 сентября 2026 года OpenAI выложила в открытый доступ MentalHealthBench — тест, который проверяет, как языковые модели ведут себя в разговорах о психическом здоровье. Критерии писали не инженеры, а больше восьмидесяти лицензированных психологов и психиатров. Лучший результат среди всех моделей — 57,3%. Это первая публичная цифра для сценария, который миллионы людей используют молча и каждый день.

Что за тест

В наборе 1215 синтетических диалогов и 5262 критерия оценки. Специалисты — 80+ практикующих психологов и психиатров из 22 стран, говорящих на 19 языках и покрывающих около двадцати субспециальностей — заранее расписали, что в конкретной ситуации ответ обязан содержать, а чего в нём быть не должно. Модель отвечает, ответ сверяют с этим списком и считают долю выполненных пунктов.

Ситуации разложены по остроте: примерно 53,5% — обычные разговоры про самочувствие и настроение, 18,2% — тяжёлые состояния, 28,3% — экстренные. И по тому, кто спрашивает: взрослые (68,1%), подростки (21,2%), сами специалисты (5,8%) и близкие, которые беспокоятся за кого-то (4,9%). Такое деление важнее, чем кажется: ответ, уместный в разговоре о выгорании, может быть опасен в остром эпизоде.

Результаты

МодельРезультат
GPT-6 Astra57,3%
GPT-6 Sol53,9%
Claude Opus 5.552,4%
GPT-6 Luna50,2%
GPT-4o32,1%
Gemini 2.5 Pro29,5%

Две вещи бросаются в глаза. Первая — разрыв между поколениями огромный: от 32,1% у GPT-4o до 57,3% у GPT-6 Astra. Модель, которой люди доверяли личное два года назад, выполняла меньше трети того, что специалисты считают обязательным. Вторая — лидеры стоят плотно, в пределах семи процентных пунктов, и выбор конкретного бренда значит куда меньше, чем выбор свежего поколения вместо старого. Подробнее про модели из верхней части таблицы — в разборах GPT-6 Astra и Claude Opus 5.5.

Что значит «57%»

Главный вывод теста не в том, кто победил, а в самой величине. Лучшая доступная модель выполняет чуть больше половины критериев, которые практикующие специалисты назвали обязательными. Это не «почти справляется» — это «регулярно упускает половину важного».

Отсюда практическая рамка. Нейросеть хорошо работает там, где нужно проговорить и разложить: сформулировать то, что мутно вертится в голове, увидеть повторяющийся сценарий, подготовиться к трудному разговору, составить вопросы к специалисту перед первой консультацией. Она доступна в три часа ночи, не устаёт и не оценивает — и именно поэтому к ней идут.

И столь же ясная граница. Модель не ставит диагноз, не ведёт терапию и не годится как помощь при остром состоянии. Если речь о риске для жизни — своей или чужой, — нужен живой человек: врач, скорая, служба экстренной психологической помощи. Тест OpenAI как раз и выделил экстренные сценарии отдельной категорией, потому что именно там ошибка стоит дороже всего.

Отдельный, но не менее важный вопрос — приватность. Разговор о личном — это самые чувствительные данные, какие вы вообще можете отправить в чат. Что происходит с историей переписки и как уменьшить след, разбирали в материале приватность в ChatGPT.

Спокойно разобраться в мыслях — без подписки

Модели OpenAI, Anthropic и Google в одном окне. Оплата рублями, без VPN. При регистрации 60 токенов.

Открыть Умку →

Как попробовать из России

Сам бенчмарк — исследовательский материал, пользователю он не нужен: это набор данных и методика, выложенные открыто, чтобы независимые команды могли проверить выводы и прогнать свои модели. Практический смысл новости другой — теперь понятно, какое поколение моделей стоит брать для таких разговоров.

Умка — агрегатор: модели OpenAI, Anthropic и Google собраны в одном окне, платить можно российской картой и без VPN. Какая именно версия сейчас подключена, видно в списке моделей внутри чата — линейки обновляются часто, и это честнее, чем фиксировать название в статье. Общий принцип выбора — в материале какую нейросеть выбрать.

Сколько это стоит

Разговор — обычный текстовый запрос, одна из самых дешёвых задач. Ответ умной модели стоит 33 токена, быстрой — 1 токен. По стартовому пакету 290 ₽ за 725 токенов это примерно 13 рублей и 40 копеек соответственно; на пакет приходится около 21 ответа умной модели или сотни быстрых. Для серьёзной темы лучше брать умную: разница между поколениями в тесте как раз про то, насколько аккуратно модель держит контекст и не срезает углы.

Крупные пакеты выгоднее: 690 ₽ за 1 811 токенов, 1 490 ₽ за 4 172, 3 900 ₽ за 11 700. Подписки нет, остаток не сгорает. При регистрации начисляют 60 токенов без карты, а 8 моделей из 367 работают бесплатно.

Коротко

MentalHealthBench впервые дал число там, где раньше были только личные впечатления: лучшая модель — 57,3%, прошлое поколение — около 30%. Это одновременно и повод относиться к ИИ в разговорах о личном серьёзнее, чем к игрушке, и повод не принимать его за специалиста. Рабочая формула простая: нейросеть — чтобы сформулировать и подготовиться, живой человек — чтобы лечить. А при остром состоянии — сразу к людям, минуя чат.

Источники: анонс OpenAI, Unite.AI.

300+ нейросетей в одном окне

Тексты, разборы, картинки и озвучка в одном чате. За рубли, без подписки и зарубежных карт.

Попробовать бесплатно →

Частые вопросы

Что такое MentalHealthBench?

Это открытый тест, который OpenAI опубликовала 23 сентября 2026 года. В нём 1215 синтетических диалогов о психическом здоровье и 5262 критерия оценки, написанные более чем 80 лицензированными психологами и психиатрами из 22 стран, говорящими на 19 языках. Модель получает диалог, её ответ сверяют с критериями специалистов и считают долю выполненных.

Какая нейросеть лучше отвечает на тяжёлые темы?

По результатам MentalHealthBench первое место заняла GPT-6 Astra с 57,3%. Дальше идут GPT-6 Sol с 53,9%, Claude Opus 5.5 с 52,4% и GPT-6 Luna с 50,2%. Модели прошлых поколений отстают заметно: GPT-4o набрала 32,1%, Gemini 2.5 Pro — 29,5%. Разрыв между поколениями больше, чем между лидерами.

Может ли нейросеть заменить психолога?

Нет, и цифры теста это показывают прямо: даже лучшая модель выполнила чуть больше половины критериев, которые специалисты считают обязательными. Нейросеть хорошо помогает разложить мысли, сформулировать чувства и подготовиться к разговору с живым специалистом. Она не ставит диагноз, не ведёт терапию и не годится в качестве помощи при остром состоянии — там нужен врач или служба экстренной помощи.

Сколько стоит поговорить с ИИ в Умке?

Один ответ умной модели стоит 33 токена — около 13 рублей по стартовому пакету 290 рублей за 725 токенов. Ответ быстрой модели — 1 токен, примерно 40 копеек. На стартовый пакет приходится порядка 21 ответа умной модели. При регистрации начисляют 60 токенов без карты, а 8 моделей из 367 доступны бесплатно.