Model
Model explorer
Yi-1.5 9B
OPEN01.AI · Yi-1.5 family · released May 13, 2024
Popular mid-size Yi-1.5 variant, continually pretrained on 3.6T tokens; top performer among similarly sized open models at launch.
ReasoningCodingVisionFunction callingTool useAgentic
351.4
Elo · rank #350
Parameters
9B
Active params
9B (dense)
Context
4K tokens
Architecture
Dense Llama-style decoder-only transformer
License
Apache 2.0
Languages
—
API price (in/out)
No hosted API
Modalities
text
Benchmark results
Bar shows position within the tracked field; marker = field best
best: OLMo 3-Think 32B · 88.2%
best: Tülu 2+DPO 70B · 95.1%
best: Llama 3.1 405B · 96.9%
best: Qwen3-235B-A22B (Non-Thinking) · 96.1%
best: ERNIE 4.5 300B-A47B · 94.3%
best: Doubao-1.5-Pro · 90.9%
best: GPT-6 Astra · 96.0%
best: Llama 3.1 405B · 96.8%
best: Mistral Small 3.2 (24B) · 92.9%
best: Claude Opus 4.5 · 99.4%
best: Gemma 4 26B A4B · 98.5%
best: GPT-5 · 99.4%
best: Llama 3.1 405B · 88.6%
best: Llama-3.3-Nemotron-Super-49B v1 (Reasoning On) · 91.3%
best: Claude Fable 5 · 91.5%
best: OpenAI o3 · 92.9%
best: Hunyuan-Large (A52B) · 9.4
Run it locally
VRAM @ Q4
6 GB
VRAM @ FP16
18 GB
Fits on (Q4)
RTX 3060 12GBRTX 4070 Ti 16GBRTX 3090 24GBRTX 4090 24GBRTX 5090 32GBM4 Pro 48GBM3 Max 128GBM3 Ultra 512GBA100 80GBH100 80GBH200 141GBB200 192GB
Throughput data unavailable.
Quantizations
GGUF Q4
Fine-tune it
PermissiveQLoRA7.7 GB1× RTX 3060 12GB
LoRA20.7 GB1× RTX 3090 24GB
Full fine-tune146.0 GB1× B200 192GB
QLoRA SFT on ~10k samples ≈ $5.27 (1× RTX 3060 12GB)
Resources
API price weights · each benchmark row carries its own source badge (see methodology)