Leaderboard

Model rankings and performance comparison across all benchmark tasks.

Rank ModelOverall Avg Score Best Score Runs
1
kimi-k2.7-code
76.0
83.22
2
glm-5.1
Zhipu
74.7
81.62
3
gpt-5.5
74.5
79.93
4
glm-5.2
Zhipu
72.9
80.72
5
minimax-m3
MiniMax
71.4
81.72
6
mimo-v2.5-pro
70.6
80.32
7
qwen3.6-plus
Alibaba
70.6
77.63
8
qwen3.6-flash
Alibaba
70.2
78.73
9
opus-4.8
68.8
74.83
10
kimi-k2.6
68.6
78.82
11
minimax-m2.7
MiniMax
68.4
79.02
12
deepseek-v4-pro
DeepSeek
65.6
81.13
13
deepseek-v4-flash
DeepSeek
60.5
76.03
14
qwen3.5-397b-a17b
Alibaba
57.0
72.43
15
qwen3.6-27b
Alibaba
54.5
66.73
16
qwen3.5-flash
Alibaba
54.0
64.92
17
qwen3.5-27b
Alibaba
31.6
50.53

Domain Heatmap

Model performance across domains. Scores range from 0 to 100.

Model Calendar & Task Mgmt Coding & Software Dev Communication & Email Deep Research & Report DevOps & Env Repair Documents & Knowledge E-commerce & Daily Svcs Finance & Data Analytics Health & Fitness Social Media
kimi-k2.7-code 68.8 73.1 62.7 68.4 72.9 85.5 84.2 95.9 78.2 61.2
glm-5.1 75.5 68.6 77.3 64.2 73.2 81.1 81.1 87.7 73.2 62.0
gpt-5.5 72.0 66.3 62.4 67.2 75.7 82.5 78.1 98.7 77.5 56.7
glm-5.2 65.0 64.6 65.3 65.0 80.9 69.0 78.7 95.9 71.0 61.2
minimax-m3 59.3 68.2 67.8 64.6 72.6 86.9 76.1 83.8 66.2 61.4
mimo-v2.5-pro 62.5 67.2 67.4 59.3 66.3 77.5 80.6 94.0 71.1 53.0
qwen3.6-plus 60.2 72.0 73.5 60.2 78.5 78.5 76.3 95.4 58.1 42.4
qwen3.6-flash 67.8 52.9 73.0 60.6 75.1 76.1 74.3 93.3 67.2 53.5
opus-4.8 43.5 57.7 63.8 68.7 70.8 87.8 85.8 77.7 62.6 44.2
kimi-k2.6 65.3 65.7 59.1 66.2 66.3 73.4 76.9 79.5 69.3 54.1
minimax-m2.7 55.2 57.3 70.2 51.1 77.5 79.5 76.3 91.8 59.2 54.4
deepseek-v4-pro 63.3 69.7 68.1 44.7 62.6 75.1 79.3 75.8 71.8 43.0
deepseek-v4-flash 38.3 71.3 56.4 54.2 62.8 77.1 71.5 80.0 44.8 33.5
qwen3.5-397b-a17b 45.6 62.2 58.4 53.0 60.4 68.6 64.3 69.0 33.2 44.1
qwen3.6-27b 33.8 48.4 69.1 36.4 59.6 89.5 68.7 67.4 27.1 30.6
qwen3.5-flash 25.7 59.0 18.1 65.3 66.0 70.2 55.5 73.5 39.2 36.0
qwen3.5-27b 15.3 68.6 41.3 25.4 27.0 53.8 32.8 23.7 21.2 14.7

Factor Heatmap

Model performance across complexity factors. Scores range from 0 to 100.

Model A1A2B1B2C1C2
kimi-k2.7-code 73.6 72.5 65.0 73.9 75.2 66.1
glm-5.1 73.3 73.3 66.1 71.9 85.7 58.9
gpt-5.5 72.4 70.4 64.2 68.9 83.3 55.0
glm-5.2 70.0 73.0 63.6 64.7 83.3 60.6
minimax-m3 67.7 70.6 65.0 75.4 49.0 55.0
mimo-v2.5-pro 67.2 66.4 59.4 69.2 73.8 49.4
qwen3.6-plus 67.8 71.8 59.5 68.3 64.3 55.0
qwen3.6-flash 66.7 68.0 57.9 68.7 73.8 66.1
opus-4.8 65.5 61.8 55.5 79.1 53.8 38.9
kimi-k2.6 67.7 63.6 59.8 67.3 59.5 53.3
minimax-m2.7 68.9 68.7 58.0 68.8 61.0 70.0
deepseek-v4-pro 66.1 59.7 59.6 64.8 47.1 43.9
deepseek-v4-flash 54.7 58.7 53.2 66.6 33.3 64.4
qwen3.5-397b-a17b 54.1 55.0 46.0 61.5 52.4 64.4
qwen3.6-27b 51.4 51.9 49.0 76.2 19.0 38.9
qwen3.5-flash 44.0 57.2 44.0 60.5 35.7 26.7
qwen3.5-27b 25.3 33.2 27.2 49.7 15.7 38.9

Difficulty Breakdown

Model performance by difficulty level. Scores range from 0 to 100.

kimi-k2.7-code
easy 95.6
medium 67.3
hard 25.9
glm-5.1
easy 95.3
medium 63.2
hard 27.7
gpt-5.5
easy 93.4
medium 67.7
hard 22.0
glm-5.2
easy 91.6
medium 65.0
hard 24.3
minimax-m3
easy 92.3
medium 59.0
hard 25.7
mimo-v2.5-pro
easy 90.7
medium 62.6
hard 17.2
qwen3.6-plus
easy 95.3
medium 57.3
hard 13.2
qwen3.6-flash
easy 94.3
medium 57.2
hard 14.3
opus-4.8
easy 93.1
medium 56.6
hard 10.2
kimi-k2.6
easy 91.8
medium 55.0
hard 18.3
minimax-m2.7
easy 94.8
medium 48.9
hard 19.5
deepseek-v4-pro
easy 84.6
medium 58.0
hard 15.2
deepseek-v4-flash
easy 81.9
medium 48.1
hard 13.0
qwen3.5-397b-a17b
easy 82.0
medium 37.6
hard 12.8
qwen3.6-27b
easy 82.3
medium 33.4
hard 4.7
qwen3.5-flash
easy 79.5
medium 34.6
hard 5.0
qwen3.5-27b
easy 47.1
medium 20.0
hard 3.4
Score scale: 0-100 · Metrics: overall, bestScore, easy, medium, hard, A1, A2, B1, B2, C1, C2 · Source: HuggingFace