ModelRefs / ARC-AGI Leaderboard — AI Model Scores

ARC-AGI Leaderboard — AI Model Scores

Abstraction and Reasoning Corpus — visual grid puzzles testing fluid intelligence. Current leaders, methodology, and citation sources for ARC-AGI.

Overview

Abstraction and Reasoning Corpus — visual grid puzzles testing fluid intelligence.

How it is measured: Pass@2 on private evaluation set; very low ceiling for current LLMs.

How this benchmark is scored

Categoryreasoning
Maximum score100 % solved
DirectionHigher is better
Evidence depthcomplete

Primary source: https://arcprize.org/

Published results

ModelScore
GPT-532.4
Claude Opus 424.5
DeepSeek R121

Each score reflects the protocol and date of its own source run. Results from different harnesses are not directly comparable.

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to ARC-AGI Leaderboard — AI Model Scores.