Model
Model explorer

Claude Sonnet 4.5

CLOSED
Anthropic · Claude 4 family · released Sep 29, 2025

Best coding/agent Sonnet at release, reported to sustain focus on complex tasks for 30+ hours.

ReasoningCodingVisionFunction callingTool useAgentic
1938.8
Elo · rank #80
Parameters
Undisclosed
Active params
Context
200K tokens
Architecture
Dense transformer, hybrid-reasoning (parameter count undisclosed)
License
Proprietary
Languages
API price (in/out)
$3 / $15
Modalities
text · vision
Benchmark results
Bar shows position within the tracked field; marker = field best
AIMEMath87.0%#59
best: GPT-5.2 · 100.0%
ARC-AGI-2Reasoning13.6%#26
best: GPT-6 Astra · 95.0%
BrowseCompAgents43.9%#38
best: Kimi K3 · 91.2%
CharXivVision67.0%#32
best: Qwen3.8-Flash-Next · 90.6%
GAIAAgents74.5%#2
best: MiniMax-M2 · 75.7%
GDPval-AAAgents1276#33
best: Claude Fable 5 · 1932
GPQA DiamondReasoning83.4%#71
best: GPT-6 Astra · 96.0%
Humanity's Last ExamReasoning33.6%#45
best: Claude Opus 5 · 64.7%
LiveCodeBenchCoding73.0%#63
best: DeepSeek-V4-Pro (Think Max) · 93.5%
MMLUKnowledge89.5%#14
best: OpenAI o3 · 92.9%
MMMU-ProVision67.5%#39
best: Claude Opus 4.7 · 85.5%
MMMUVision77.8%#28
best: Claude Fable 5 · 89.3%
OSWorld-VerifiedAgents61.4%#25
best: Claude Fable 5 · 85.0%
SWE-bench VerifiedCoding77.2%#33
best: Claude Opus 5 · 96.0%
τ²-Bench RetailAgents86.2%#4
best: Claude Sonnet 4.6 · 91.7%
τ²-Bench TelecomAgents98.0%#7
best: Claude Opus 4.6 · 99.3%
Terminal-Bench 2.0Coding51.0%#60
best: Gemini 3.8 Flash · 89.4%
API price $3/$15 · each benchmark row carries its own source badge (see methodology)