ベンチマーク 🔥 HOT
Humanity's Last Exam(HLE)とは?
別名: 人類最後の試験
数%→数十%へ急伸するAIの正答率で読むAGI接近度。CAISとScale AIが集めた約2,500問の超難問ベンチ。
⚡ 30秒でわかる
Humanity's Last Exam(HLE) の主なポイント
- 1 HLE(Humanity's Last Exam)は、AI安全センター(CAIS)とScale AIが約1,000人の専門家と共に作った、100以上の分野にわたる約2,500問の超難問ベンチマークです。
- 2 MMLUなど従来のテストをAIがほぼ解き切ってしまった(ベンチマークの飽和)ため、その上限を超える物差しとして2025年初頭に公開されました。
- 3 登場直後はトップAIでも正答率は数%でしたが、推論モデルの進化で2026年には数十%まで上昇し、進化スピードを測る指標になっています。
- 4 人間の専門家でも自分の専門分野で9割ほどしか取れない設計で、AGI到達度を占うベンチマークとして注目されています。
📖 詳しく
Humanity's Last Exam(HLE) とは
Humanity's Last Exam(HLE、人類最後の試験)は、AIが人類の知の最前線にどこまで迫れたかを測るために作られた、超難問のベンチマークです。AI安全センター(CAIS)とScale AIが世界50か国・約1,000人の専門家から集めた、数学・自然科学・人文学など100以上の分野にわたる約2,500問で構成されています。なぜ重要かというと、MMLUのような従来テストはAIが満点近くを取ってしまい「もう実力差が測れない(ベンチマークの飽和)」状態になったため、その上限を突き抜ける新しい物差しが必要になったからです。たとえるなら、模試で全員が満点を取るようになったので、各分野の博士が頭をひねるレベルの問題だけを集めた「最終試験」を用意したようなものです。実際この試験は人間の専門家でも自分の専門分野で9割ほどしか取れない難しさで、登場した2025年初頭はトップAIでも正答率は数%でした。その後、考えてから答える推論モデルの登場で2026年には数十%まで急上昇しており、AGI(汎用人工知能)にどれだけ近づいたかを占う指標として注目を集めています。
❓ FAQ
よくある質問
- Q. HLE(Humanity's Last Exam)とは何ですか?
- A. AIが人類の知の最前線にどこまで迫れたかを測るための、超難問ベンチマークです。AI安全センター(CAIS)とScale AIが世界中の専門家と作った、100以上の分野にわたる約2,500問で構成されています。「これに答えられたらもう人類の試験は出し尽くした」という意味で『人類最後の試験』と名付けられました。
- Q. MMLU や GPQA など他のベンチマークと何が違うのですか?
- A. MMLUは大学レベルの総合学力テストですが、AIがほぼ満点を取れるようになり実力差が測れなくなりました。HLEはその飽和を乗り越えるために、各分野の専門家でないと解けないレベルまで難易度を引き上げた点が最大の違いです。理系博士課程レベルのGPQAよりさらに範囲が広く、人文学なども含む幅広い最難問を集めています。
- Q. AIのHLEのスコアはどれくらいですか?
- A. 公開された2025年初頭はトップのAIでも正答率は数%にとどまっていました。その後、答える前に考える推論モデルの進化で2026年には数十%台まで急上昇しています。参考までに、人間の専門家でも自分の専門分野で正答率は9割ほどとされ、それだけ難しい試験です。
- Q. 初心者がHLEのスコアを見るときの注意点は?
- A. スコアの絶対値より「短期間でどれだけ伸びているか」という進化のスピードに注目すると分かりやすいです。また数字は測定条件(推論を許すか、ツール使用の有無など)で変わるため、別々のニュースの数字を単純比較しないよう注意しましょう。スコアが高い=AGI達成、ではなく、あくまで難問への対応力を測る一指標と捉えるのが安全です。
🔗 関連
あわせて読みたい
関連用語
関連 AI モデル