ReasoningActive
Trust Score:
94

LiveBench (Continuous)

Monthly refreshed benchmark designed to prevent test-set contamination across reasoning, coding, mathematics, data analysis, and instruction following.

Launched: 2024-06-01Refresh: monthly

Performance Timeline

Longitudinal progression of model scores against human baselines.

Performance & Historical Trajectory

Empirical score progression across model release dates and evaluation rounds.

Independent Vendor-Reported Human Baseline (68.5%)
ModelScoreDateSource TypeProvenance
Claude Fable 583%2025-02-01independentSource ↗
GPT-5.6 Sol82.8%2025-02-01independentSource ↗
Claude Opus 580.1%2025-02-01independentSource ↗
Claude Fable 5.1 (Hybrid Reasoning)84.7%2025-02-01independentSource ↗
GPT-6 Astra (max)84.2%2025-02-01independentSource ↗
GPT-5.5 Thinking80.2%2025-02-01independentSource ↗
GPT-582%2025-02-01independentSource ↗
Kimi K382%2025-02-01independentSource ↗
Grok 481.2%2025-02-01independentSource ↗
DeepSeek V4.1 Flash83.9%2025-02-01independentSource ↗
Gemini 3.7 Flash78.8%2025-02-01independentSource ↗
Grok 4.678.5%2025-02-01independentSource ↗
Claude Sonnet 580.4%2025-02-01independentSource ↗
Gemini 3 Pro79.8%2025-02-01independentSource ↗
Claude 3.7 Sonnet81.5%2025-02-01independentSource ↗
DeepSeek V4-Pro77.9%2025-02-01independentSource ↗
o382.5%2025-02-01independentSource ↗
Gemini 3.6 Flash77.2%2025-02-01independentSource ↗
Qwen3-235B77.4%2025-02-01independentSource ↗
Anthropic: Claude Opus 5.580.5%2025-02-01independentSource ↗
OpenAI: GPT-6 Astra Pro80.5%2025-02-01independentSource ↗
Anthropic: Claude Opus 580.5%2025-02-01independentSource ↗
OpenAI: GPT-5.6 Terra Pro80.5%2025-02-01independentSource ↗
Google: Nano Banana Pro (Gemini 3 Pro Image)80.5%2025-02-01independentSource ↗
Anthropic: Claude Opus 4.880.5%2025-02-01independentSource ↗
OpenAI: GPT-5.5 Pro80.5%2025-02-01independentSource ↗
Anthropic: Claude Opus 4.780.5%2025-02-01independentSource ↗
OpenAI: GPT-5.4 Pro80.5%2025-02-01independentSource ↗
Google: Gemini 3.1 Pro Preview Custom Tools80.5%2025-02-01independentSource ↗
Google: Gemini 3.1 Pro Preview80.5%2025-02-01independentSource ↗
Anthropic: Claude Opus 4.680.5%2025-02-01independentSource ↗
OpenAI: GPT-5.2 Pro80.5%2025-02-01independentSource ↗
Anthropic: Claude Opus 4.580.5%2025-02-01independentSource ↗
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)80.5%2025-02-01independentSource ↗
OpenAI: GPT-5 Pro80.5%2025-02-01independentSource ↗
Anthropic: Claude Opus 4.180.5%2025-02-01independentSource ↗
OpenAI: o3 Pro80.5%2025-02-01independentSource ↗
OpenAI: o1-pro80.5%2025-02-01independentSource ↗
Gemini 2.5 Pro81%2025-02-01independentSource ↗
Nemotron 3 Ultra 550B78.5%2025-02-01independentSource ↗
DeepSeek-R180.8%2025-02-01independentSource ↗
QwQ Plus76.5%2025-02-01independentSource ↗
Amazon Nova Premier 1.078.2%2025-02-01independentSource ↗
GLM-5.277%2025-02-01independentSource ↗
Llama 4 Maverick77.1%2025-02-01independentSource ↗
Sonar Reasoning Pro80.5%2025-02-01independentSource ↗
Ollama DeepSeek-R1 (Q4_K_M)80%2025-02-01independentSource ↗
Grok 381.2%2025-02-01independentSource ↗
o3-mini80.2%2025-02-01independentSource ↗
MiniMax M376.8%2025-02-01independentSource ↗
Llama 4 Scout76%2025-02-01independentSource ↗
Sarvam 105B78.4%2025-02-01independentSource ↗
Z.ai: GLM 5.3 Prime77.9%2025-02-01independentSource ↗
OpenAI: GPT-6 Sol Pro77.9%2025-02-01independentSource ↗
Xiaomi: MiMo-V2.6-Pro-UltraSpeed77.9%2025-02-01independentSource ↗
DeepSeek: DeepSeek V4 Pro 081377.9%2025-02-01independentSource ↗
OpenAI: GPT-5.6 Sol Pro77.9%2025-02-01independentSource ↗
OpenAI: GPT-5.1-Codex-Max77.9%2025-02-01independentSource ↗
Google: Gemini 2.5 Pro77.9%2025-02-01independentSource ↗
Google: Gemini 2.5 Pro Preview 06-0577.9%2025-02-01independentSource ↗
Amazon: Nova Pro 1.077.9%2025-02-01independentSource ↗
Mistral Large77.9%2025-02-01independentSource ↗
DeepSeek V4-Flash74.5%2025-02-01independentSource ↗
Gemini 2.0 Flash Thinking74.9%2025-02-01independentSource ↗
Gemini 3.5 Flash-Lite73.8%2025-02-01independentSource ↗
o173.5%2025-02-01independentSource ↗
GPT-4.571%2025-02-01independentSource ↗
Gemini 2.0 Pro72.8%2025-02-01independentSource ↗
QwQ 32B73.8%2025-02-01independentSource ↗
Mistral Large 372%2025-02-01independentSource ↗
Qwen 2.5 Max71.4%2025-02-01independentSource ↗
Llama-3.1-Nemotron-70B-Instruct75.4%2025-02-01independentSource ↗
Qwen 2.5 72B Instruct76.5%2025-02-01independentSource ↗
Amazon Nova Pro 1.074%2025-02-01independentSource ↗
Nemotron 3 Super 120B74.2%2025-02-01independentSource ↗
OpenAI: GPT-5.6 Luna Pro74.8%2025-02-01independentSource ↗
OpenAI: GPT-5.6 Luna74.8%2025-02-01independentSource ↗
NVIDIA: Nemotron 3 Ultra74.8%2025-02-01independentSource ↗
Mistral: Mistral Large 3 251274.8%2025-02-01independentSource ↗
Phi-476.5%2025-02-01independentSource ↗
Claude 3.5 Sonnet69.8%2025-02-01independentSource ↗
Hunyuan-Large74.8%2025-02-01independentSource ↗
Nemotron-4-340B-Instruct73%2025-02-01independentSource ↗
Llama 3.3 70B Instruct75.8%2025-02-01independentSource ↗
Gemma 3 27B Preview76.2%2025-02-01independentSource ↗
Sarvam 30B74%2025-02-01independentSource ↗
Mistral Large 275.2%2025-02-01independentSource ↗
Kimi k1.570.5%2025-02-01independentSource ↗
Sonar Pro77%2025-02-01independentSource ↗
Ollama Llama 3.3 (Q4_K_M)75%2025-02-01independentSource ↗
Yi-Lightning73.5%2025-02-01independentSource ↗
Amazon Nova Pro74.2%2025-02-01independentSource ↗
DeepSeek-V367.8%2025-02-01independentSource ↗
Gemini 2.0 Flash67.5%2025-02-01independentSource ↗
Llama 3.1 405B66.8%2025-02-01independentSource ↗
MiniMax-Text-0173%2025-02-01independentSource ↗
WizardLM-2 8x22B71.5%2025-02-01independentSource ↗
Amazon Nova 2 Lite72.8%2025-02-01independentSource ↗
Qwen 2.5 Coder 32B67%2025-02-01independentSource ↗
ERNIE 4.0 Turbo71.8%2025-02-01independentSource ↗
GPT-4o66.4%2025-02-01independentSource ↗
GLM-4-Plus72.5%2025-02-01independentSource ↗
OpenAI: GPT-6 Luna Pro71.3%2025-02-01independentSource ↗
OpenAI: GPT-6 Luna71.3%2025-02-01independentSource ↗
Xiaomi: MiMo-V2.6-Pro71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V4 Pro 042371.3%2025-02-01independentSource ↗
Xiaomi: MiMo-V2.5-Pro71.3%2025-02-01independentSource ↗
Llama 3.3 70B65.2%2025-02-01independentSource ↗
Phi-4-multimodal72%2025-02-01independentSource ↗
Reka Core69.2%2025-02-01independentSource ↗
Mistral Large 263.4%2025-02-01independentSource ↗
Gemma 2 27B71.5%2025-02-01independentSource ↗
Solar Pro68%2025-02-01independentSource ↗
Gemini 1.5 Pro64.1%2025-02-01independentSource ↗
DBRX Instruct67.2%2025-02-01independentSource ↗
Google: Lyria 3 Pro Preview67.8%2025-02-01independentSource ↗
Snowflake Arctic66.5%2025-02-01independentSource ↗
Amazon Nova Lite69.5%2025-02-01independentSource ↗
GPT-4o mini56.2%2025-02-01independentSource ↗
OpenAI: GPT-6 Astra80.5%2025-02-01independentSource ↗
Anthropic: Claude Fable 5.180.5%2025-02-01independentSource ↗
OpenAI: GPT-5.6 Terra80.5%2025-02-01independentSource ↗
Anthropic: Claude Fable 580.5%2025-02-01independentSource ↗
OpenAI: GPT Chat Latest80.5%2025-02-01independentSource ↗
OpenAI: GPT-5.580.5%2025-02-01independentSource ↗
OpenAI: GPT-5.4 Image 280.5%2025-02-01independentSource ↗
OpenAI: GPT-5.480.5%2025-02-01independentSource ↗
OpenAI: GPT-5.3-Codex80.5%2025-02-01independentSource ↗
Anthropic: Claude Sonnet 4.680.5%2025-02-01independentSource ↗
OpenAI: GPT-5.2-Codex80.5%2025-02-01independentSource ↗
OpenAI: GPT-5.2 Chat80.5%2025-02-01independentSource ↗
OpenAI: GPT-5.280.5%2025-02-01independentSource ↗
Amazon: Nova Premier 1.080.5%2025-02-01independentSource ↗
Anthropic: Claude Sonnet 4.580.5%2025-02-01independentSource ↗
Anthropic: Claude Sonnet 480.5%2025-02-01independentSource ↗
OpenAI: o180.5%2025-02-01independentSource ↗
OpenAI: GPT-4o (2024-05-13)80.5%2025-02-01independentSource ↗
OpenAI: GPT-4 Turbo80.5%2025-02-01independentSource ↗
OpenAI: GPT-480.5%2025-02-01independentSource ↗
QwQ-32B Preview79.2%2025-02-01independentSource ↗
OpenAI: GPT-6 Sol77.9%2025-02-01independentSource ↗
Google: Gemini 3.8 Flash77.9%2025-02-01independentSource ↗
Google: Gemini 3.7 Flash77.9%2025-02-01independentSource ↗
Google: Gemini 3.6 Flash77.9%2025-02-01independentSource ↗
OpenAI: GPT-5.6 Sol77.9%2025-02-01independentSource ↗
Anthropic: Claude Sonnet 577.9%2025-02-01independentSource ↗
Google: Gemini 3.5 Flash77.9%2025-02-01independentSource ↗
Mistral: Mistral Medium 3.577.9%2025-02-01independentSource ↗
Z.ai: GLM 5.177.9%2025-02-01independentSource ↗
Z.ai: GLM 5V Turbo77.9%2025-02-01independentSource ↗
OpenAI: GPT-5.4 Mini77.9%2025-02-01independentSource ↗
Z.ai: GLM 5 Turbo77.9%2025-02-01independentSource ↗
OpenAI: GPT Audio77.9%2025-02-01independentSource ↗
OpenAI: GPT-5.177.9%2025-02-01independentSource ↗
OpenAI: GPT-5.1-Codex77.9%2025-02-01independentSource ↗
Anthropic: Claude Haiku 4.577.9%2025-02-01independentSource ↗
OpenAI: GPT-5 Image77.9%2025-02-01independentSource ↗
OpenAI: GPT-577.9%2025-02-01independentSource ↗
OpenAI: o4 Mini High77.9%2025-02-01independentSource ↗
OpenAI: o377.9%2025-02-01independentSource ↗
OpenAI: o4 Mini77.9%2025-02-01independentSource ↗
OpenAI: GPT-4.177.9%2025-02-01independentSource ↗
OpenAI: o3 Mini High77.9%2025-02-01independentSource ↗
OpenAI: o3 Mini77.9%2025-02-01independentSource ↗
OpenAI: GPT-4o (2024-11-20)77.9%2025-02-01independentSource ↗
OpenAI: GPT-4o (2024-08-06)77.9%2025-02-01independentSource ↗
OpenAI: GPT-4o77.9%2025-02-01independentSource ↗
Mistral: Mixtral 8x22B Instruct77.9%2025-02-01independentSource ↗
OpenAI: GPT-3.5 Turbo 16k77.9%2025-02-01independentSource ↗
Gemini 2.5 Flash (Thinking)79.8%2025-02-01independentSource ↗
Claude 3.5 Sonnet (v2)78.5%2025-02-01independentSource ↗
Nemotron-4-340B-Reward74.5%2025-02-01independentSource ↗
Cohere: Command A+74.8%2025-02-01independentSource ↗
Z.ai: GLM 5.3 FlashX74.8%2025-02-01independentSource ↗
Tencent: Hy4 preview74.8%2025-02-01independentSource ↗
Google: Gemini 3.5 Flash Lite74.8%2025-02-01independentSource ↗
Google: Nano Banana 2 Lite (Gemini 3.1 Flash Lite Image)74.8%2025-02-01independentSource ↗
Google: Nano Banana 2 (Gemini 3.1 Flash Image)74.8%2025-02-01independentSource ↗
Z.ai: GLM 5.274.8%2025-02-01independentSource ↗
Google: Gemini 3.1 Flash Lite74.8%2025-02-01independentSource ↗
OpenAI: GPT-5.4 Nano74.8%2025-02-01independentSource ↗
Google: Gemini 3.1 Flash Lite Preview74.8%2025-02-01independentSource ↗
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)74.8%2025-02-01independentSource ↗
Z.ai: GLM 574.8%2025-02-01independentSource ↗
OpenAI: GPT Audio Mini74.8%2025-02-01independentSource ↗
Z.ai: GLM 4.774.8%2025-02-01independentSource ↗
Google: Gemini 3 Flash Preview74.8%2025-02-01independentSource ↗
Mistral: Devstral 2 251274.8%2025-02-01independentSource ↗
OpenAI: GPT-5.1-Codex-Mini74.8%2025-02-01independentSource ↗
OpenAI: GPT-5 Image Mini74.8%2025-02-01independentSource ↗
Google: Nano Banana (Gemini 2.5 Flash Image)74.8%2025-02-01independentSource ↗
Z.ai: GLM 4.674.8%2025-02-01independentSource ↗
Mistral: Mistral Medium 3.174.8%2025-02-01independentSource ↗
Z.ai: GLM 4.5V74.8%2025-02-01independentSource ↗
OpenAI: GPT-5 Mini74.8%2025-02-01independentSource ↗
Z.ai: GLM 4.574.8%2025-02-01independentSource ↗
Google: Gemini 2.5 Flash74.8%2025-02-01independentSource ↗
DeepSeek: R1 052874.8%2025-02-01independentSource ↗
Mistral: Mistral Medium 374.8%2025-02-01independentSource ↗
OpenAI: GPT-4.1 Mini74.8%2025-02-01independentSource ↗
OpenAI: GPT-3.5 Turbo (older v0613)74.8%2025-02-01independentSource ↗
OpenAI: GPT-3.5 Turbo Instruct74.8%2025-02-01independentSource ↗
OpenAI: GPT-3.5 Turbo74.8%2025-02-01independentSource ↗
Sarvam Vision (Document AI)73.2%2025-02-01independentSource ↗
Saaras v3 (Speech-to-Text)71.5%2025-02-01independentSource ↗
Sonar74%2025-02-01independentSource ↗
Xiaomi: MiMo-V2.6-Flash71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V4.1 Flash71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V4 Flash Vision Exp71.3%2025-02-01independentSource ↗
Tencent: Hy-MT2-30B-A3B71.3%2025-02-01independentSource ↗
Tencent: Hy-MT2-7B71.3%2025-02-01independentSource ↗
Z.ai: GLM 5.371.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V4 Flash 073171.3%2025-02-01independentSource ↗
Tencent: Hy371.3%2025-02-01independentSource ↗
Tencent: Hy3 preview71.3%2025-02-01independentSource ↗
Xiaomi: MiMo-V2.571.3%2025-02-01independentSource ↗
Google: Gemma 4 26B A4B 71.3%2025-02-01independentSource ↗
Google: Gemma 4 31B71.3%2025-02-01independentSource ↗
Mistral: Mistral Small 471.3%2025-02-01independentSource ↗
NVIDIA: Nemotron 3 Super71.3%2025-02-01independentSource ↗
Z.ai: GLM 4.7 Flash71.3%2025-02-01independentSource ↗
Z.ai: GLM 4.6V71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V3.271.3%2025-02-01independentSource ↗
Mistral: Voxtral Small 24B 250771.3%2025-02-01independentSource ↗
OpenAI: gpt-oss-safeguard-20b71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V3.2 Exp71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V3.1 Terminus71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V3.171.3%2025-02-01independentSource ↗
OpenAI: GPT-5 Nano71.3%2025-02-01independentSource ↗
OpenAI: gpt-oss-120b71.3%2025-02-01independentSource ↗
Mistral: Codestral 250871.3%2025-02-01independentSource ↗
Z.ai: GLM 4.5 Air71.3%2025-02-01independentSource ↗
Google: Gemini 2.5 Flash Lite71.3%2025-02-01independentSource ↗
Tencent: Hunyuan A13B Instruct71.3%2025-02-01independentSource ↗
Mistral: Mistral Small 3.2 24B71.3%2025-02-01independentSource ↗
OpenAI: GPT-4.1 Nano71.3%2025-02-01independentSource ↗
Meta: Llama 4 Maverick71.3%2025-02-01independentSource ↗
Meta: Llama 4 Scout71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V3 032471.3%2025-02-01independentSource ↗
Mistral: Mistral Small 3.1 24B71.3%2025-02-01independentSource ↗
Google: Gemma 3 27B71.3%2025-02-01independentSource ↗
Mistral: Saba71.3%2025-02-01independentSource ↗
DeepSeek: R1 Distill Llama 70B71.3%2025-02-01independentSource ↗
DeepSeek: DeepSeek V371.3%2025-02-01independentSource ↗
Meta: Llama 3.3 70B Instruct71.3%2025-02-01independentSource ↗
Amazon: Nova Lite 1.071.3%2025-02-01independentSource ↗
Meta: Llama 3.2 1B Instruct71.3%2025-02-01independentSource ↗
Meta: Llama 3.2 3B Instruct71.3%2025-02-01independentSource ↗
Cohere: Command R (08-2024)71.3%2025-02-01independentSource ↗
Meta: Llama 3.1 70B Instruct71.3%2025-02-01independentSource ↗
OpenAI: GPT-4o-mini71.3%2025-02-01independentSource ↗
OpenAI: GPT-4o-mini (2024-07-18)71.3%2025-02-01independentSource ↗
Google: Gemma 2 27B71.3%2025-02-01independentSource ↗
Bulbul v3 (Text-to-Speech)70%2025-02-01independentSource ↗
Amazon Nova Lite 1.069.5%2025-02-01independentSource ↗
Z.ai: GLM 5.3 Flash67.8%2025-02-01independentSource ↗
Tencent: Hy-MT2-1.8B67.8%2025-02-01independentSource ↗
NVIDIA: Nemotron 3.5 Lightning67.8%2025-02-01independentSource ↗
NVIDIA: Nemotron 3.5 Content Safety67.8%2025-02-01independentSource ↗
DeepSeek: DeepSeek V4 Flash 042367.8%2025-02-01independentSource ↗
Google: Lyria 3 Clip Preview67.8%2025-02-01independentSource ↗
NVIDIA: Nemotron 3 Nano 30B A3B67.8%2025-02-01independentSource ↗
Mistral: Ministral 3 14B 251267.8%2025-02-01independentSource ↗
Mistral: Ministral 3 8B 251267.8%2025-02-01independentSource ↗
Mistral: Ministral 3 3B 251267.8%2025-02-01independentSource ↗
OpenAI: gpt-oss-20b67.8%2025-02-01independentSource ↗
Meta: Llama Guard 4 12B67.8%2025-02-01independentSource ↗
Google: Gemma 3 4B67.8%2025-02-01independentSource ↗
Google: Gemma 3 12B67.8%2025-02-01independentSource ↗
Mistral: Mistral Small 367.8%2025-02-01independentSource ↗
Microsoft: Phi 467.8%2025-02-01independentSource ↗
Cohere: Command R7B (12-2024)67.8%2025-02-01independentSource ↗
Amazon: Nova Micro 1.067.8%2025-02-01independentSource ↗
Meta: Llama 3.1 8B Instruct67.8%2025-02-01independentSource ↗
Mistral: Mistral Nemo67.8%2025-02-01independentSource ↗
Sarvam 2B (Sarvam-1)66.8%2025-02-01independentSource ↗
Phi-4-mini68.4%2025-02-01independentSource ↗
Amazon Nova Micro 1.064.2%2025-02-01independentSource ↗
Gemma 2 9B66.8%2025-02-01independentSource ↗
Gemma 2 2B56.4%2025-02-01independentSource ↗

Human Baseline & Difficulty Horizon

Calibrated human reference points, specialist benchmarks, and ceiling thresholds.
Measured Human Score68.5%Domain Expert Baseline
Baseline Protocol & Interpretation

Average score achieved by domain experts across monthly refreshed problem sets.

Metric & Scoring Methodology

Verification protocols, aggregation formulas, and specialized metric variants.
Primary Metric:Composite Score %
Scoring Engine:composite

Dataset & Compute Cost

Evaluation volume, public availability, API pricing, and local hardware requirements.
Total Dataset Size1,800Annotated evaluation items
Public Test SetPublicOpenly mirrored on repositories
Access GatingOpen AccessUnrestricted download
Evaluation LicenseOpen AccessDataset usage and redistribution terms
Frontier API Compute Cost:

$5 – $20 USD for full benchmark evaluation run on frontier APIs.

Recommended Local GPU Setup:

1x NVIDIA RTX 4090 (24GB) or A100 (40GB/80GB) via vLLM / SGLang

Official Dataset & Benchmark Files:Download / View Dataset Repository ↗

How to Run & Reproduce

Standardized evaluation protocols, CLI commands, and reproducible runner templates.
Prompt Regimezero-shot
Reasoning Modedirect
Sampling Temp0
Pass@k Budgetk = 1
Tools & SandboxPure Text
Scoring Verifiercomposite
Option AEleutherAI LM-Evaluation-Harness (Open-Weight Models)
lm_eval --model hf --model_args pretrained=<model_path> --tasks livebench --batch_size auto
Option BOpenCompass Evaluation Framework
opencompass --datasets livebench --models <model_config>
Python APIDeterministic Inference Loop Snippet
# Standard API Evaluation Loop
from openai import OpenAI

client = OpenAI()
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": prompt}],
    temperature=0.0,
)
Standardized Reporting Requirement:

When publishing results for LiveBench (Continuous), always report the exact prompt template, few-shot exemplar ordering, sampling temperature (temperature=0), maximum reasoning budget tokens, and the precise timestamped model snapshot ID.

Contamination & Memorization Analysis

Audit of pretraining exposure risks, memorization vectors, and refresh policies.
Overall Contamination Risk:LOW
Refresh Cadence:

Static fixed snapshot

Test Set Exposure:

Public on web / HuggingFace