新ベンチマーク「TAM」がGPT-5の長期的手続き推論能力に大きな課題を提示:ICD-10-CM臨床コーディングで厳密一致性能1%に留まる

arXiv 不明
概要
大規模言語モデル(LLM)の長期的手続き推論能力を正確に評価するため、新たなベンチマーク「Tasks over Application Manuals (TAM)」がarXivで発表されました。TAMは、ICD-10-CM臨床コーディングや米国連邦量刑といった実世界タスクを特徴とし、数万のルールに基づくマニュアルに従って多段階の推論を要求します。GPT-5を用いた評価では、ICD-10-CMコーディングでわずか1%、量刑タスクで15.5%という極めて低い厳密一致性能が明らかになり、従来のベンチマークがLLMの真の推論能力を過大評価していた可能性が指摘されています。
詳細

主要成果

大規模言語モデル(LLM)の長期的かつ多段階の手続き推論能力には依然として大きなギャップが存在することが、arXivで発表された新しいベンチマーク「Tasks over Application Manuals (TAM)」によって明らかになりました。最先端モデルであるGPT-5を用いた評価では、ICD-10-CM臨床コーディングタスクでわずか1%の厳密一致性能、米国連邦量刑タスクでも15.5%という極めて低い結果が示されました。これは、従来のベンチマークがLLMの推論能力を過大評価している可能性を示唆しています。

技術詳細

TAMベンチマークは、現実世界の問題解決能力をより厳密に評価するために設計されました。これには、医療分野のICD-10-CM臨床コーディングと、法律分野の米国連邦量刑ガイドラインという2つの複雑なドメインが含まれています。これらのタスクは、数万にも及ぶルールが記述された専門マニュアルに基づき、複数の相互依存するステップを実行し、正確な最終回答を生成することをLLMに要求します。この多段階推論と厳密なルール遵守の必要性が、従来の単純な質疑応答や短文生成タスクとは一線を画します。

背景・業界文脈

近年、LLMは多様なタスクで目覚ましい進歩を遂げていますが、特に複雑な手続き的推論や、大規模な知識体系に基づいた厳密な論理展開が必要な場面では、その限界が指摘されていました。TAMの導入は、このギャップを客観的に評価し、LLM開発の新たな方向性を示すものです。医療コーディングや法律分野のような高精度が要求される領域では、現在のLLMの性能では実用化には程遠く、さらなる基礎研究と技術革新が不可欠であることを浮き彫りにしています。

今後の展望

TAMベンチマークは、LLMが専門的なマニュアルや規制に厳密に従って推論する能力を向上させるための重要なツールとなるでしょう。GPT-5で示された低性能は、LLMが人間の専門家のように複雑なルール体系をナビゲートし、多段階の意思決定を行う能力を向上させるための研究開発の必要性を明確に示しています。このベンチマークを通じて、よりロバストで信頼性の高いLLMが開発され、最終的には医療、法律、エンジニアリングなどの分野でのAIアシスタントの可能性が大きく広がることが期待されます。

元記事: https://arxiv.org/abs/2609.13005

毎週の技術動向レポートを無料でお届け

各分野の分析レポートを読む価値があるかどうか一目で判断できるインフォグラフィックをメールで受け取れます。

📢 メールマガジンに無料登録(週刊・技術動向レポート)

ご登録いただくと、Troy-Technical から週刊で技術動向レポート(メールマガジン)をお届けします。

  • 取得したメールアドレス・選択分野は配信目的にのみ使用します。
  • 第三者へ提供することはありません。
  • 配信はいつでも解除できます(各メール下部のリンクから)。

詳しくはプライバシーポリシーをご覧ください。

登録は1分・いつでも解除できます

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

この記事を書いた人

コメント

コメントする

目次