主要成果
2026年7月の最新LLMベンチマークにおいて、AnthropicのClaude Opus 5とClaude Mythos 5が、総合性能(HLE)、ターミナル使用(Terminal-Bench 2.1)、エージェントコーディング(SWE-Bench)、および高度な推論(GPQA Diamond)の各カテゴリーでトップスコアを達成し、最先端のモデルとしてその優位性を示しました。同時に、Grok 4.5は、トップモデルの性能に近接しながらも大幅に低いコストを実現する「ベストニアフロンティアバリュー」として脚光を浴びています。
技術・臨床詳細
今回公開されたベンチマークは、GPT-5、Claude、Gemini、DeepSeek、Llamaなど、215のランク付けされたモデルと297の追跡されたAIモデルを、371に及ぶ多様なベンチマークで比較しています。主な評価カテゴリーとその結果は以下の通りです。
- 総合性能(HLE: Human-Level Evaluation): Claude Opus 5とClaude Mythos 5が人間の評価基準に最も近い性能を発揮し、複雑な指示理解と高品質な応答生成能力を証明しました。
- 推論能力(GPQA Diamond): 高度な科学的推論を要求するGPQA Diamondベンチマークにおいて、Claude Opus 5とClaude Mythos 5が優れた成績を収め、複雑な問題解決能力を示しました。
- エージェントコーディング(SWE-Bench): ソフトウェアエンジニアリングタスクにおけるエージェントの能力を測るSWE-Benchでは、これらのClaudeモデルが最も効率的かつ正確なコード生成・修正能力を発揮しました。
- ターミナル使用(Terminal-Bench 2.1): 実際の開発環境でのツール使用能力を評価するTerminal-Bench 2.1においても、Claudeモデルが優位に立ちました。
性能だけでなく、モデルの運用コスト効率も重要な評価指標とされています。Grok 4.5は、トップスコアの91%の性能を維持しつつ、出力価格が88%低いという驚異的なコストパフォーマンスを示し、「ベストニアフロンティアバリュー」として特に中小企業やコストに敏感な開発者にとって魅力的な選択肢となっています。また、Llama 4 Scoutが最速モデルとして、Nova Microが最も安価なモデルとしてそれぞれ特定のユースケースで優位性を示しています。
背景・業界文脈
LLMの進化は加速の一途をたどり、その性能を客観的に評価するベンチマークの重要性は増しています。多岐にわたるベンチマークが開発される中、総合的な性能だけでなく、推論、コーディング、ツール使用、そしてコスト効率といった多角的な視点からの評価が求められています。今回のリーダーボードは、Anthropicが最先端モデル開発において競争力を維持していることを示すとともに、オープンソースやよりコスト効率の高い代替モデルが特定の領域で高い価値を提供し始めている現状を浮き彫りにしています。
今後の展望
これらのベンチマーク結果は、AI研究者、エンジニア、および企業がLLMを選択し、導入する上での重要なガイドラインとなります。高性能モデルは最先端のAIアプリケーションを可能にし、Grok 4.5のようなコスト効率の良いモデルは、より広範なビジネスへのAI導入を促進するでしょう。今後、ベンチマークはさらに多様化し、特定の産業やタスクに特化した評価が求められるようになると予測されます。この競争環境は、LLMの性能とアクセシビリティの継続的な向上を促し、AI技術の普及と発展を加速させることになります。
元記事: https://benchlm.ai/
毎週の技術動向レポートを無料でお届け
各分野の分析レポートを読む価値があるかどうか一目で判断できるインフォグラフィックをメールで受け取れます。
📢 メールマガジンに無料登録(週刊・技術動向レポート)
ご登録いただくと、Troy-Technical から週刊で技術動向レポート(メールマガジン)をお届けします。
- 取得したメールアドレス・選択分野は配信目的にのみ使用します。
- 第三者へ提供することはありません。
- 配信はいつでも解除できます(各メール下部のリンクから)。
詳しくはプライバシーポリシーをご覧ください。
登録は1分・いつでも解除できます

コメント