Model
Model explorer
Qwen3-8B (Thinking)
OPENAlibaba · Qwen3 family · released Apr 29, 2025
Popular small dense Gen-3 model; thinking mode gives outsized AIME/GPQA scores for its size.
ReasoningCodingVisionFunction callingTool useAgentic
1311.4
Elo · rank #169
Parameters
8.2B
Active params
8.2B (dense)
Context
128K tokens
Architecture
Dense transformer, GQA + SwiGLU + QK-Norm
License
Apache 2.0
Languages
119+
API price (in/out)
$0.072 / $0.287
Modalities
text
Benchmark results
Bar shows position within the tracked field; marker = field best
best: GPT-5.2 · 100.0%
best: Qwen3-235B-A22B (Non-Thinking) · 96.1%
best: Hunyuan-A13B · 78.3%
best: Qwen3.6-Plus · 93.3%
best: DeepSeek-V4-Pro (Think Max) · 3206
best: GPT-6 Astra · 96.0%
best: Claude Opus 5 · 64.7%
best: MiniMax M3 · 83.0%
best: Gemma 4 26B A4B · 98.5%
best: DeepSeek-V4-Pro (Think Max) · 93.5%
best: GPT-5 · 99.4%
best: Qwen3.7-Max · 95.0%
best: Gemini 3.1 Pro · 92.6%
Run it locally
VRAM @ Q4
5.1 GB
VRAM @ FP16
16.4 GB
Fits on (Q4)
RTX 3060 12GBRTX 4070 Ti 16GBRTX 3090 24GBRTX 4090 24GBRTX 5090 32GBM4 Pro 48GBM3 Max 128GBM3 Ultra 512GBA100 80GBH100 80GBH200 141GBB200 192GB
Throughput data unavailable.
Quantizations
GGUF · AWQ · GPTQ · MLX
Fine-tune it
PermissiveQLoRA7.2 GB1× RTX 3060 12GB
LoRA19.1 GB1× RTX 3090 24GB
Full fine-tune133.2 GB1× H200 141GB
QLoRA SFT on ~10k samples ≈ $4.80 (1× RTX 3060 12GB)
Qwen3 family
Elo progression across releases
Qwen3-14B (Non-Thinking)Apr 20251060.2Qwen3-14B (Thinking)Apr 20251382.9Qwen3-235B-A22B (Non-Thinking)Apr 20251213.0Qwen3-235B-A22B (Thinking)Apr 20251516.1Qwen3-30B-A3B (Non-Thinking)Apr 20251070.4Qwen3-30B-A3B (Thinking)Apr 20251452.3Qwen3-32B (Non-Thinking)Apr 20251097.1Qwen3-32B (Thinking)Apr 20251484.0Qwen3-8B (Non-Thinking)Apr 2025900.6Qwen3-8B (Thinking)Apr 20251311.4Qwen3-235B-A22B-Instruct-2507Jul 20251559.3Qwen3-235B-A22B-Thinking-2507Jul 20251827.4
API price $0.072/$0.287 · each benchmark row carries its own source badge (see methodology)