Knowledge
Humanity's Last Exam
Humanity's Last Exam — 2500-question frontier benchmark; per-item binary correct/incorrect from supaihq judged data + deepwriter Gemini-3 data.
1,792items
19subjects
MITlicense
knowledgedomain
reasoningdomain
textmodality
item-level responses released
Saturation status: No
Response matrix
Fit to width. Hover for subject & item; click a cell for details.

Correct (1)Incorrect (0)Unobserved
Scale: 1 = correct · 0 = incorrect
Subjects
- 1Sup-AI-Ensemble0.5215
- 2Gemini-3-Pro-Preview0.4565
- 3GPT-5-Pro0.3953
- 4GPT-5.10.3823
- 5Qwen3-VL-Thinking0.3333
- 6Claude-Opus-4.50.2966
- 7Grok-40.2905
- 8DeepSeek-V3.2-Thinking0.2413
- 9GLM-4.60.2308
- 10Claude-Sonnet-4.50.1811
- 11Kimi-K2-Thinking-Turbo0.1755
- 12Qwen3-Next-80B-A3B-Thinking0.175
- 13Qwen3-Max0.1731
- 14MiniMax-M20.1667
- 15Gemini-2.5-Pro0.1651
- 16Mistral-Magistral-Medium0.1351
- 17Mistral-Large0.0588
- 18Gemini-2.5-Flash0
- 19DeepSeek-V3.2-Exp-Thinking0