OpenAI、メンタルヘルス関連の対話を評価する基準「MentalHealthBench」を公開

シン@AI統制&マルチエージェント

シン@AI統制&マルチエージェント

OpenAIは2026年9月23日、AIモデルによるメンタルヘルス関連の対応を評価するための基準「MentalHealthBench」を公開したと発表した。22か国から参加した資格を持つメンタルヘルスの専門家80人超(約20の専門分野、19言語)と共同で開発したという。

このベンチマークは、日常的なストレスに関する会話から、緊急性の高い深刻な相談まで、3段階の緊急度にまたがる合成対話(実在の相談ではなく評価用に作成された会話)を対象とする。評価対象には成人だけでなく、13〜17歳の未成年者、家族等の介護者、臨床従事者向けの会話も含まれる。評価の観点としては、本人の意思決定の尊重、状況・背景の丁寧な確認、安全性への配慮、状況に応じた具体的な行動支援などが挙げられている。

採点の仕組みは、専門家が作成した採点基準(マイナス10からプラス10までの重み付け)に基づく。各会話は少なくとも3人の専門家がレビューし、2人以上が一致し、かつ3人目が明確に反対していない基準のみを採点に採用したという。実際の自動採点には、OpenAIの別モデル「GPT-5.6 Sol」が使われているとされる。

これとは別に、16か国・14言語の利用経験者44人を対象にした調査も紹介されている。この調査は、利用者と専門家それぞれの視点を比較する目的で、緊急性の低い日常会話を対象に実施されたもので、利用者は専門家よりも「具体的な次の一歩」や「話し方・トーン」を重視する傾向が見られたという。ただし、この調査結果によってベンチマーク自体の最終的な採点基準が変更されたわけではないと明記されている。

OpenAIは、ChatGPTは専門的な治療やケアの代替ではないと説明している。この評価が測るのは、合成会話の最後のユーザー発言に対するモデルの応答であり、実際の治療成績や長期的な健康への影響ではない。

同社は研究者が検証・活用できるオープンなベンチマークとして案内し、論文を公開している。ただし、今回の確認ではデータセットと採点コードの具体的な配布先を特定できなかった。

出典(2026年9月24日確認)

https://openai.com/index/introducing-mentalhealthbench/

https://cdn.openai.com/ctf-cdn/MentalHealthBench_A_Comprehensive_Benchmark_of_AI_Capabilities_in_Realistic_Mental_Health_Conversations.pdf


あなたも記事の投稿・販売を
始めてみませんか?

Tipsなら簡単に記事を販売できます!
登録無料で始められます!

Tipsなら、無料ですぐに記事の販売をはじめることができます Tipsの詳細はこちら
 

この記事の販売者

シン@AI統制&マルチエージェント

人とAIの役割を組み立て、構想を使える成果物へ。教育・営業・接客・介護・事務の経験を背景に、個人プロジェクト「Human OS」で複数AIとの協働を設計・実践しています。教材・記事制作では企画、役割分担、品質の確認、改善を担当。課題を整理し、進め方を見直しながら形にする力を、業務改善・AI活用・プロジェクト推進へ広げていきます。

この販売者が書いた他の記事

  • xAI、新モデル「Grok 4.7」を発表 長時間タスク向けの強化学習や自己点検機能を強化

  • GLM-5.3は「攻撃を組み立てるAI」の敷居を下げたのか――AnthropicとNISTの検証を読む

  • Gemini Liveが「目の前」を声で案内――Guided Visionは、AIが人の視界を補う新しい形

関連のおすすめ記事

  • ゼロから3日で始動|AIコンサル大全

    ¥124,800
    1 %獲得
    (1,248 円相当)
    水口一星

    水口一星

  • 【AI自動化・マネタイズ実例書】たった2週間〜機械オンチなママでもできた全作業過程

    ¥37,800
    1 %獲得
    (378 円相当)
    みお

    みお

  • 【5年更新型コンテンツ】AIを最大活用するためのリテラシー強化バイブル

    ¥59,800
    1 %獲得
    (598 円相当)
    こはく

    こはく