Benchmarks
Benchmarks
MT-Bench
Human preferenceunit /10 · normalized over [4, 9.5]Multi-turn conversation quality, GPT-4-judged 1-10 scale.
#ModelSourceScoreNormalized
Score distribution
69 tracked results across the normalization window
49.5
Score vs. parameters
Open-weights models, log-x params