Model
Model explorer
OLMo 3-Think 32B
OPENAllen Institute for AI (Ai2) · OLMo 3 family · released Nov 20, 2025
Latest flagship and strongest fully open reasoning model; narrows the gap to Qwen 3-32B-Thinking on reasoning benchmarks while trained on ~6x fewer tokens.
ReasoningCodingVisionFunction callingTool useAgentic
1448.0
Elo · rank #147
Parameters
32.23B
Active params
32.23B (dense)
Context
64K tokens
Architecture
Dense transformer (decoder-only, sliding/full attention mix, exposed CoT)
License
Apache 2.0
Languages
1+
API price (in/out)
$0.15 / $0.5
Modalities
text
Benchmark results
Bar shows position within the tracked field; marker = field best
best: this model · 88.2%
best: GPT-5.2 · 100.0%
best: Tülu 2+DPO 70B · 95.1%
best: ERNIE 4.5 300B-A47B · 94.3%
best: GPT-6 Astra · 96.0%
best: Claude Opus 5 · 64.7%
best: Mistral Small 3.2 (24B) · 92.9%
best: MiniMax M3 · 83.0%
best: Gemma 4 26B A4B · 98.5%
best: DeepSeek-V4-Pro (Think Max) · 93.5%
best: GPT-5 · 99.4%
best: Llama 3.1 405B · 88.6%
best: Claude Fable 5 · 91.5%
best: OpenAI o3 · 92.9%
Run it locally
VRAM @ Q4
20 GB
VRAM @ FP16
65 GB
Fits on (Q4)
RTX 3090 24GBRTX 4090 24GBRTX 5090 32GBM4 Pro 48GBM3 Max 128GBM3 Ultra 512GBA100 80GBH100 80GBH200 141GBB200 192GB
Throughput data unavailable.
Quantizations
GGUF Q4
Fine-tune it
PermissiveQLoRA22.3 GB1× RTX 3090 24GB
LoRA69.0 GB1× A100 80GB
Full fine-tune517.7 GB4× H200 141GB
QLoRA SFT on ~10k samples ≈ $16.60 (1× RTX 3090 24GB)
API price $0.15/$0.5 · each benchmark row carries its own source badge (see methodology)