1195 current measurements across 9 benchmarks.

GPQA Diamond312

Graduate-level physics, chemistry and biology questions written to be Google-proof. The Diamond subset is the hardest, most expert-validated slice.

ModelScoreMeasured byEvaluatorConditionsDateSource
GPT-6 Astra95.8%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0137; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.8 Flash95.4%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.014; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.7 Flash94.8%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.0135; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.4 Pro94.6%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.016; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.1 Pro94.4%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.0163; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.6 Flash94.1%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.014; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.1 Pro94.1%Third partyEpoch AIzero-shot · no tools · inspect · stderr 0.017; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Grok 4.694.0%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.0145; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.594.0%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.0155; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.5 Pro93.9%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.0158; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Opus 593.9%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0148; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.6 Sol93.5%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0157; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Grok 4.593.4%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.0143; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.6 Terra93.3%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0154; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.493.3%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.018; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Grok 4.693.2%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.0152; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Kimi K393.1%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0149; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Opus 592.9%Third partyEpoch AIzero-shot · no tools · inspect · stderr 0.0183; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.5 Flash92.8%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.0164; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Qwen 3.8 Max92.7%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.0169; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3 Pro92.6%Third partyEpoch AIzero-shot · no tools · inspect · stderr 0.0165; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Qwen3.8 Max (0902)92.3%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · stderr 0.0172; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Kimi K391.9%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · stderr 0.0194; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GLM-5.291.9%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0161; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
DeepSeek V4 Pro 081391.7%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · stderr 0.0152; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link

Showing the top 25 of 312 tracked measurements on this benchmark.

FrontierMath337

Unpublished research-level mathematics problems, held private to limit contamination. Tiers 1-3 are hard; Tier 4 is research-frontier.

ModelScoreMeasured byEvaluatorConditionsDateSource
GPT-6 Astra98.0%VendorOpenAIVendor claim as stated in “FrontierMath Tier 4”. Conditions not published with the figure;…Link
GPT-6 Astra97.6%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.024; Epoch AI house conditions: zero-shot chain…Link
GPT-6 Astra97.6%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.024; Epoch AI house conditions: zero-shot chain…Link
GPT-6 Astra97.6%Third partyEpoch AIeffort high · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.024; Epoch AI house conditions: zero-shot chain…Link
GPT-6 Astra97.6%Third partyEpoch AIeffort medium · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0244; Epoch AI house conditions: zero-shot chai…Link
GPT-6 Astra93.7%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0144; Epoch AI house conditions: zero-shot c…Link
Claude Fable 590.2%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.046; Epoch AI house conditions: zero-shot chain…Link
Claude Fable 5.190.2%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0177; Epoch AI house conditions: zero-shot c…Link
GPT-5.6 Sol89.1%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0185; Epoch AI house conditions: zero-shot c…Link
Claude Fable 5.187.8%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0517; Epoch AI house conditions: zero-shot chai…Link
GPT-6 Astra87.8%Third partyEpoch AIeffort low · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0517; Epoch AI house conditions: zero-shot chai…Link
GPT-5.5 Pro87.7%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0195; Epoch AI house conditions: zero-shot c…Link
Claude Fable 587.0%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0199; Epoch AI house conditions: zero-shot c…Link
GPT-5.6 Terra86.0%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0206; Epoch AI house conditions: zero-shot c…Link
Claude Opus 585.6%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0208; Epoch AI house conditions: zero-shot c…Link
GPT-5.585.3%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.021; Epoch AI house conditions: zero-shot ch…Link
GPT-6 Astra82.9%Third partyEpoch AIeffort none · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0595; Epoch AI house conditions: zero-shot chai…Link
GPT-5.6 Sol82.9%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0595; Epoch AI house conditions: zero-shot chai…Link
GPT-5.4 Pro82.5%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0226; Epoch AI house conditions: zero-shot c…Link
GPT-5.6 Luna82.1%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0227; Epoch AI house conditions: zero-shot c…Link
GPT-5.6 Sol80.5%Third partyEpoch AIzero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0627; Epoch AI house conditions: zero-shot chai…Link
Claude Opus 4.880.0%Third partyEpoch AIeffort max · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0237; Epoch AI house conditions: zero-shot c…Link
GPT-5.478.6%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · FrontierMath Tiers 1-3 v2 (private); stderr 0.0243; Epoch AI house conditions: zero-shot c…Link
GPT-5.5 Pro78.0%Third partyEpoch AIeffort xhigh · zero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.0654; Epoch AI house conditions: zero-shot chai…Link
AI Co-Mathematician75.6%Third partyEpoch AIzero-shot · no tools · inspect · FrontierMath Tier 4 v2 (private); stderr 0.067; Epoch AI house conditions: zero-shot chain…Link

Showing the top 25 of 337 tracked measurements on this benchmark.

SWE-bench Verified35

Real GitHub issues from Python repositories, human-validated as solvable. Scores are meaningless without the scaffold that produced them.

ModelScoreMeasured byEvaluatorConditionsDateSource
Claude Opus 4.783.5%Third partyEpoch AIeffort max · zero-shot · tools · inspect · stderr 0.0169; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.580.6%Third partyEpoch AIeffort xhigh · zero-shot · tools · inspect · stderr 0.018; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.5 Flash79.3%Third partyEpoch AIeffort high · zero-shot · tools · inspect · stderr 0.0184; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Opus 4.678.7%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0186; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GLM-5.278.7%Third partyEpoch AIeffort max · zero-shot · tools · inspect · stderr 0.0187; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
DeepSeek-V4-Pro77.6%Third partyEpoch AIeffort max · zero-shot · tools · inspect · stderr 0.019; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Qwen3.7-Max77.3%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0191; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.476.9%Third partyEpoch AIeffort high · zero-shot · tools · inspect · stderr 0.0192; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Qwen 3.6 Max (Preview)76.7%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0192; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Kimi K2.676.7%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0192; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Opus 4.576.7%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0192; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3.1 Pro75.6%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0195; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Opus 4.675.6%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0195; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3 Flash75.4%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0196; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Sonnet 4.675.2%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0196; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-5.3 Codex74.8%Third partyEpoch AIeffort high · zero-shot · tools · inspect · stderr 0.0198; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GLM-5.174.2%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0199; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Kimi K2.573.8%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.02; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt, A…Link
GPT-5.273.8%Third partyEpoch AIeffort high · zero-shot · tools · inspect · stderr 0.02; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt, A…Link
GPT-573.5%Third partyEpoch AIeffort high · zero-shot · tools · inspect · stderr 0.0201; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Opus 4.173.3%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0201; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Gemini 3 Pro72.9%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0202; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GLM-572.1%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0209; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
GPT-571.5%Third partyEpoch AIeffort medium · zero-shot · tools · inspect · stderr 0.0205; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link
Claude Sonnet 4.571.3%Third partyEpoch AIzero-shot · tools · inspect · stderr 0.0206; Epoch AI house conditions: zero-shot chain-of-thought, empty system prompt,…Link

Showing the top 25 of 35 tracked measurements on this benchmark.

Terminal-Bench201

End-to-end tasks in a real terminal sandbox. Measures an agent plus its harness, not a model on its own.

ModelScoreMeasured byEvaluatorConditionsDateSource
GPT-5.584.7%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: NexAU-AHE; stderr 0.021Link
GPT-5.583.1%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Capy; stderr 0.021Link
GPT-5.582.2%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Codex CLI; stderr 0.022Link
GPT-5.582.0%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Codex; stderr 0.022Link
GPT-5.481.8%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: ForgeCode; stderr 0.02Link
Claude Opus 4.780.2%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: WOZCODE; stderr 0.021Link
Gemini 3.1 Pro80.2%CommunityTerminal-Bench leaderboardtools · agent: TongAgents; stderr 0.026Link
Claude Opus 4.679.8%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: ForgeCode; stderr 0.016Link
GPT-5.3 Codex78.4%CommunityTerminal-Bench leaderboardtools · agent: SageAgent; stderr 0.022Link
Gemini 3.1 Pro78.4%CommunityTerminal-Bench leaderboardtools · agent: ForgeCode; stderr 0.018Link
Gemini 3.1 Pro78.4%CommunityTerminal-Bench v2 Leaderboardtools · agent: Forge Code; stderr 0.018Link
GPT-5.3 Codex77.3%CommunityTerminal-Bench leaderboardtools · agent: Droid; stderr 0.022Link
Claude Opus 4.676.4%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Meta-Harness; stderr 0.024Link
GPT-5.3 Codex75.8%CommunityTerminal-Bench leaderboardtools · agent: CodeBrain-1.5; stderr 0.02Link
GPT-5.3 Codex75.7%CommunityTerminal-Bench leaderboardtools · agent: Codelia; stderr 0.022Link
Claude Opus 4.675.3%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Capy; stderr 0.024Link
GPT-5.3 Codex75.1%CommunityTerminal-Bench leaderboardtools · agent: Simple Codex; stderr 0.024Link
Gemini 3.1 Pro74.8%CommunityTerminal-Bench leaderboardtools · agent: Terminus-KIRA; stderr 0.026Link
Claude Opus 4.674.7%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Terminus-KIRA; stderr 0.026Link
GPT-5.3 Codex74.6%CommunityTerminal-Bench leaderboardtools · agent: Mux; stderr 0.025Link
Claude Opus 4.672.1%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: MAYA-V2; stderr 0.022Link
Claude Opus 4.671.9%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: TongAgents; stderr 0.027Link
GPT-5.3 Codex71.5%CommunityTerminal-Bench leaderboardtools · agent: spoox-o-m; stderr 0.025Link
GPT-5.3 Codex70.3%CommunityTerminal-Bench leaderboardtools · agent: CodeBrain-1; stderr 0.026Link
Claude Opus 4.669.9%CommunityTerminal-Bench leaderboardeffort unknown · tools · agent: Droid; stderr 0.025Link

Showing the top 25 of 201 tracked measurements on this benchmark.

ARC-AGI-2172

Grid puzzles designed so that each task needs a rule inferred from a handful of examples rather than recalled.

ModelScoreMeasured byEvaluatorConditionsDateSource
GPT-6 Astra95.0%CommunityARC Prize leaderboardeffort max · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-6 Astra93.3%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.6 Sol92.5%CommunityARC Prize leaderboardeffort max · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-6 Astra92.1%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-6 Astra92.1%CommunityARC Prize leaderboardeffort medium · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Opus 590.4%CommunityARC Prize leaderboardeffort max · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 5.190.0%CommunityARC Prize leaderboardeffort max · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 5.190.0%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.6 Sol90.0%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 589.2%CommunityARC Prize leaderboardeffort max · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 5.188.8%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Opus 588.3%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 588.3%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 587.5%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Claude Fable 5.186.3%CommunityARC Prize leaderboardeffort medium · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-6 Astra85.4%CommunityARC Prize leaderboardeffort low · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.6 Sol85.4%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.585.0%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Gemini 3.7 Flash84.6%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.5 Pro84.6%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
Gemini 3 Deep Think84.6%CommunityARC Prize leaderboardno tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.5 Pro84.2%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.6 Terra83.9%CommunityARC Prize leaderboardeffort max · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.583.3%CommunityARC Prize leaderboardeffort high · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink
GPT-5.4 Pro83.3%CommunityARC Prize leaderboardeffort xhigh · no tools · Redistributed by Epoch AI from ARC Prize leaderboard; run conditions not published per-rowLink

Showing the top 25 of 172 tracked measurements on this benchmark.

LiveBench21

Contamination-limited suite with monthly question refreshes and objective ground truth — no LLM judge. Scores from different question-set months are not comparable.

ModelScoreMeasured byEvaluatorConditionsDateSource
Gemini 2.5 Pro (Mar 2025)82.3CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
GPT-5.178.8CommunityLiveBench Leaderboardeffort high · no tools · Redistributed by Epoch AI from LiveBench Leaderboard; run conditions not published per-rowLink
Claude 3.7 Sonnet76.1CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25; note: Assumed baseline 3.7 SonnetLink
o3-mini75.9CommunityLiveBench Leaderboardeffort high · no tools · question set: LiveBench-2024-11-25Link
QwQ-32B72.0CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
DeepSeek-R171.6CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
o3-mini70.0CommunityLiveBench Leaderboardeffort medium · no tools · question set: LiveBench-2024-11-25Link
GPT-4.569.0CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Gemini 2.0 Flash Thinking (Jan 2025)66.9CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
DeepSeek-V3 (Mar 2025)66.9CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Claude 3.7 Sonnet65.6CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Gemini 2.0 Pro65.1CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
o3-mini62.5CommunityLiveBench Leaderboardeffort low · no tools · question set: LiveBench-2024-11-25Link
Qwen2.5-Max62.3CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Gemini 2.0 Flash (Feb 2025)61.5CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
DeepSeek-R1-Distill-Llama-70B54.5CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Gemini 2.0 Flash-Lite54.3CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Gemma 3 27B50.0CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
DeepSeek-R1-Distill-Qwen-32B45.5CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Mistral Small 3.144.0CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link
Mistral Small 342.5CommunityLiveBench Leaderboardno tools · question set: LiveBench-2024-11-25Link

Aider Polyglot52

Exercism coding exercises across six languages, run through the Aider edit loop. The edit format is part of the result.

ModelScoreMeasured byEvaluatorConditionsDateSource
GPT-588.0%CommunityAider LLM Leaderboardseffort high · tools · edit format: diffLink
GPT-586.7%CommunityAider LLM Leaderboardseffort medium · tools · edit format: diffLink
o3-pro84.9%CommunityAider LLM Leaderboardseffort high · tools · edit format: diffLink
Gemini 2.5 Pro (Jun 2025)83.1%CommunityAider LLM Leaderboardstools · edit format: diff-fencedLink
GPT-581.3%CommunityAider LLM Leaderboardseffort low · tools · edit format: diffLink
o381.3%CommunityAider LLM Leaderboardseffort high · tools · edit format: diffLink
Grok 479.6%CommunityAider LLM Leaderboardseffort high · tools · edit format: diffLink
Grok 479.6%CommunityAider LLM Leaderboardstools · edit format: diffLink
Gemini 2.5 Pro (Jun 2025)79.1%CommunityAider LLM Leaderboardstools · edit format: diff-fenced; note: No thinking parameter set; default thinking token lengthLink
o376.9%CommunityAider LLM Leaderboardseffort unknown · tools · edit format: diffLink
Gemini 2.5 Pro (May 2025)76.9%CommunityAider LLM Leaderboardstools · edit format: diff-fencedLink
o376.9%CommunityAider LLM Leaderboardseffort medium · tools · edit format: diffLink
DeepSeek-V3.274.2%CommunityAider LLM Leaderboardstools · edit format: diffLink
DeepSeek-V3.2-Exp74.2%CommunityAider LLM Leaderboardseffort thinking · tools · edit format: diffLink
Gemini 2.5 Pro (Mar 2025)72.9%CommunityAider LLM Leaderboardstools · edit format: diff-fencedLink
o4-mini72.0%CommunityAider LLM Leaderboardseffort high · tools · edit format: diffLink
DeepSeek-R1 (May 2025)71.4%CommunityAider LLM Leaderboardstools · edit format: diffLink
Claude Opus 470.7%CommunityAider LLM Leaderboardstools · edit format: diffLink
DeepSeek-V3.2-Exp70.2%CommunityAider LLM Leaderboardstools · edit format: diffLink
Claude 3.7 Sonnet60.4%CommunityAider LLM Leaderboardstools · edit format: diffLink
o3-mini60.4%CommunityAider LLM Leaderboardseffort high · tools · edit format: diffLink
Qwen3-235B-A22B-Instruct (Jul 2025)59.6%CommunityAider LLM Leaderboardstools · edit format: diffLink
Qwen3-235B-A22B59.6%CommunityAider LLM Leaderboardstools · edit format: diff; note: no cost dataLink
Kimi K2 (Sep 2025)59.1%CommunityAider LLM Leaderboardstools · edit format: diffLink
Kimi K2 (Jul 2025)59.1%CommunityAider LLM Leaderboardstools · edit format: diffLink

Showing the top 25 of 52 tracked measurements on this benchmark.

Humanity's Last Exam45

Expert-written questions across a wide range of academic subjects, built to stay hard after the rest of the field saturates.

ModelScoreMeasured byEvaluatorConditionsDateSource
Claude Fable 5.146.5%CommunityHumanity's Last Exam leaderboardeffort xhigh · no tools · stderr 0.02Link
Gemini 3.1 Pro46.4%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.0196Link
GPT-5.4 Pro44.3%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0195Link
Muse Spark40.6%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.0192Link
Gemini 3 Pro37.5%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.019Link
GPT-5.436.2%CommunityHumanity's Last Exam leaderboardeffort xhigh · no tools · stderr 0.0188Link
Claude Opus 4.736.2%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0188Link
Claude Opus 4.634.4%CommunityHumanity's Last Exam leaderboardeffort max · no tools · stderr 0.0186Link
GPT-5 Pro31.6%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0182Link
GPT-5.227.8%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0176Link
GPT-525.3%CommunityHumanity's Last Exam leaderboardeffort high · no tools · stderr 0.017Link
Claude Opus 4.525.2%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.017Link
Kimi K2.524.4%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.0181Link
GPT-5.123.7%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0167Link
Gemini 2.5 Pro (Jun 2025)21.6%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.0161Link
o320.3%CommunityHumanity's Last Exam leaderboardeffort high · no tools · stderr 0.0158Link
GPT-5 mini19.4%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0155Link
o319.2%CommunityHumanity's Last Exam leaderboardeffort medium · no tools · stderr 0.0154Link
Claude Opus 4.619.0%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.0154Link
Gemini 2.5 Pro (Mar 2025)18.2%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.0151Link
o4-mini18.1%CommunityHumanity's Last Exam leaderboardeffort high · no tools · stderr 0.0151Link
Gemini 2.5 Pro (May 2025)17.8%CommunityHumanity's Last Exam leaderboardno tools · stderr 0.015Link
o4-mini14.3%CommunityHumanity's Last Exam leaderboardeffort medium · no tools · stderr 0.0137Link
Claude Opus 4.514.2%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0137Link
Claude Sonnet 4.513.7%CommunityHumanity's Last Exam leaderboardeffort unknown · no tools · stderr 0.0135Link

Showing the top 25 of 45 tracked measurements on this benchmark.

OSWorld20

Open-ended computer-use tasks in a real desktop environment, scored by execution rather than by a judge.

ModelScoreMeasured byEvaluatorConditionsDateSource
Claude Sonnet 4.672.1%CommunityOS World Websitetools · agent: claude-sonnet-4-6 (100 steps)Link
Claude Opus 4.566.3%VendorAnthropictools · agent: Claude Opus 4.5Link
Kimi K2.563.3%CommunityOS World Websitetools · agent: Kimi-K2.5Link
Claude Sonnet 4.562.9%CommunityOS World Websitetools · agent: claude-sonnet-4-5-20250929 (100 steps)Link
Claude Sonnet 4.558.1%CommunityOS World Websitetools · agent: claude-sonnet-4-5-20250929 (50 steps)Link
Claude Sonnet 443.9%CommunityOS World Websitetools · agent: claude-4-sonnet-20250514 (50 steps)Link
Claude Sonnet 4.542.9%CommunityOS World Websitetools · agent: claude-sonnet-4-5-20250929 (15 steps)Link
Claude Sonnet 441.4%CommunityOS World Websitetools · agent: claude-4-sonnet-20250514 (100 steps)Link
Claude 3.7 Sonnet35.8%CommunityOS World Websitetools · agent: claude-3-7-sonnet-20250219 (50 steps)Link
Claude 3.7 Sonnet35.6%CommunityOS World Websitetools · agent: claude-3-7-sonnet-20250219 (100 steps)Link
computer-use-preview-2025-03-1131.3%CommunityOS World Websitetools · agent: computer-use-preview (50 steps)Link
Claude Sonnet 431.2%CommunityOS World Websitetools · agent: claude-4-sonnet-20250514 (15 steps)Link
computer-use-preview-2025-03-1130.5%CommunityOS World Websitetools · agent: computer-use-preview (100 steps)Link
Claude 3.7 Sonnet27.1%CommunityOS World Websitetools · agent: claude-3-7-sonnet-20250219 (15 steps)Link
computer-use-preview-2025-03-1126.0%CommunityOS World Websitetools · agent: computer-use-preview (15 steps)Link
o323.0%CommunityOS World Websiteeffort medium · tools · agent: o3 (100 steps)Link
o317.2%CommunityOS World Websiteeffort medium · tools · agent: o3 (50 steps)Link
o39.1%CommunityOS World Websiteeffort medium · tools · agent: o3 (15 steps)Link
Qwen2.5-72B5.0%CommunityOS World Websitetools · agent: qwen2.5-vl-72b-instruct (100 steps)Link
Qwen2.5-72B4.4%CommunityOS World Websitetools · agent: qwen2.5-vl-72b-instruct (15 steps)Link

Roundups

No roundups yet. They are written only when the data does something worth writing about — a new leader, a retraction, or a vendor's own number failing to reproduce.