EN ← トップへ戻る
生成AI

OpenAI「MentalHealthBench」公開|80人超の専門家がAIの相談応答を評価

OpenAIがメンタルヘルス相談におけるAIの応答を測る公開ベンチマークを発表。22か国の専門家が作成した評価基準と限界を解説。

記事ID:TC-0032 公開:

OpenAIは2026年9月23日、メンタルヘルスに関する会話でAIの応答を評価する公開ベンチマーク「MentalHealthBench」を発表しました。22か国の80人を超える有資格の心理・精神医療専門家と共同開発したと説明しています。

従来の安全性評価は緊急事態への対応に重点を置きがちでした。一方、実際の相談には日常的なストレス、人間関係の悩み、深刻な苦痛、緊急の支援が必要な状況まで幅があります。MentalHealthBenchは、こうした状況ごとに適切な応答を評価する設計です。

【仕組みと背景】メンタルヘルスに関する応答では、共感的な表現だけでなく、相手の状況を決めつけず適切に質問することが重要です。必要な場合に専門家への相談を促す判断も評価対象になります。

【導入時の課題】合成会話を使うことで実在の相談内容のプライバシーを守りやすくなりますが、現実の会話に含まれる複雑な背景をすべて再現できるとは限りません。評価データの多様性が重要です。

【検証と今後】専門家が複数人で採点基準を確認する方法は、単一の評価者への依存を減らす工夫です。それでも文化や言語によって適切な対応が異なる可能性は残ります。

【実務での評価方法】この技術を実際の業務に取り入れるなら、まず利用目的と成功条件を明確にし、小さな対象で試す方法が考えられます。機能が動くことだけでなく、従来の方法と比べた時間、品質、失敗時の対応を記録すると、導入の価値を判断しやすくなります。

【安全性と運用上の注意】AIや自動化を含む仕組みでは、参照する情報の正確さ、利用者の権限、操作履歴、問題発生時の停止手段を確認する必要があります。特に外部サービスや本番環境へ影響する処理では、試作時の設定をそのまま本番へ持ち込まないことが重要です。

【発表内容と実際の提供状況】公式発表に記載された機能や数値は、対象期間、検証環境、利用条件によって意味が変わります。プレビューや実証実験の結果を一般提供の実績と混同せず、最新の対応範囲や制限を一次情報で確認する必要があります。

【今後の注目点】技術の新しさだけでなく、既存の作業へ無理なく組み込めるか、導入費用に見合う効果があるか、利用者が結果を検証できるかが普及を左右します。実際の運用事例と継続的な評価が、今後の判断材料になります。

評価用の会話はプライバシーに配慮した合成データを用い、成人、13〜17歳の若者、養育者、臨床家など複数の立場を想定しています。専門家は、適切な質問、利用者の主体性の尊重、安全確保などについて細かな採点基準を作成しました。

OpenAIによると、各会話は少なくとも3人の専門家が確認し、基準は複数人の合意をもとに採用されています。総合点だけでなく、どのような行動に強みや弱みがあるかを分析できる点も特徴です。

ただし、ベンチマークで高得点を得たAIが、実際の相談で常に適切に対応できることを保証するものではありません。OpenAI自身もChatGPTは治療や専門的ケアの代わりではないと明記しています。

情報源

OpenAI(2026年9月23日) ↗