Wordle Bench

Evaluating LLMs on their Wordle-solving capabilities

Leaderboard

Rank Model Provider Success Rate Avg Guesses Avg Cost
1 gpt-5 openai
99%
3.59 $0.20
2 claude-sonnet-4.6 anthropic
98%
3.7 $0.14
3 gpt-5.4 openai
98%
3.57 $0.09
4 claude-fable-5 anthropic
97%
3.51 $0.18
5 gpt-5.5 openai
97%
3.57 $0.22
6 gpt-5.6-sol openai
97%
3.53 $0.07
7 qwen3.8-max qwen
97%
3.55 $0.25
8 claude-opus-5 anthropic
96%
3.6 $0.11
9 claude-sonnet-5 anthropic
96%
3.74 $0.04
10 muse-spark-1.2 meta
96%
3.62 $0.08
11 gpt-5.6-terra-pro openai
96%
3.5 $0.12
12 qwen3.7-plus qwen
96%
3.66 $0.02
13 claude-opus-4.6 anthropic
95%
3.58 $0.14
14 gpt-5.1 openai
95%
3.6 $0.13
15 grok-4.20-beta x-ai
95%
3.68 $0.07
16 claude-opus-4.8 anthropic
94%
3.51 $0.08
17 gemini-3-pro-preview google
94%
3.53 $0.14
18 gpt-5-mini openai
94%
3.62 $0.04
19 gpt-5.6-luna openai
94%
3.69 $0.01
20 gpt-5.6-sol-pro openai
94%
3.5 $0.34
21 claude-opus-4.5 anthropic
93%
3.62 $0.29
22 gemini-3.1-flash-lite-preview google
93%
3.69 $0.01
23 qwen3.7-max qwen
92%
3.53 $0.06
24 grok-4.5 x-ai
92%
3.62 $0.10
25 gpt-5.6-luna-pro openai
91%
3.54 $0.08
26 gpt-5.6-terra openai
91%
3.49 $0.03
27 qwen3.6-plus qwen
90%
3.56 $0.06
28 inkling-small thinkingmachines
90%
3.62 $0.01
29 gpt-5.4-mini openai
89%
3.72 $0.05
30 grok-4.1-fast x-ai
89%
3.73 $0.01
31 claude-opus-4.7 anthropic
87%
3.53 $0.10
32 claude-sonnet-4.5 anthropic
87%
3.63 $0.08
33 gemma-4-31b-it google
87%
3.56 $0.00
34 gpt-5.2 openai
87%
3.68 $0.03
35 gemini-3.6-flash google
86%
3.53 $0.07
36 kimi-k2.5 moonshotai
86%
3.59 $0.05
37 gpt-5.4-nano openai
86%
3.72 $0.01
38 qwen3-max-thinking qwen
86%
3.74 $0.24
39 gpt-5-nano openai
85%
3.69 $0.01
40 grok-4.3 x-ai
85%
3.74 $0.05
41 mimo-v2-flash xiaomi
85%
3.65 $0.00
42 mistral-medium-3-5 mistralai
84%
3.87 $0.30
43 qwen3-next-80b-a3b-thinking qwen
83%
3.69 $0.04
44 kimi-k2.6 moonshotai
81%
3.75 $0.21
45 mimo-v2-pro xiaomi
81%
3.77 $0.03
46 claude-haiku-4.5 anthropic
80%
3.71 $0.08
47 inkling thinkingmachines
80%
3.5 $0.09
48 mimo-v2.5-pro xiaomi
80%
3.76 $0.04
49 glm-5.2 z-ai
78%
3.74 $0.07
50 deepseek-v4-flash-0731 deepseek
77%
3.58 $0.00
51 gemini-3.1-pro-preview google
75%
3.64 $0.19
52 glm-5-turbo z-ai
75%
3.73 $0.03
53 gemini-3.5-flash-lite google
74%
3.58 $0.02
54 gemini-2.5-pro google
72%
3.6 $0.16
55 gpt-oss-120b openai
72%
3.74 $0.01
56 nemotron-3-ultra-550b-a55b nvidia
71%
3.79 $0.03
57 gemini-3.5-flash google
66%
3.44 $0.06
58 gemini-2.5-flash google
63%
3.83 $0.03
59 qwen3.5-397b-a17b qwen
63%
3.63 $0.08
60 glm-5 z-ai
63%
3.59 $0.06
61 mistral-small-2603 mistralai
61%
3.98 $0.01
62 kimi-k3 moonshotai
60%
3.57 $0.41
63 nemotron-3-nano-30b-a3b nvidia
58%
3.66 $0.01
64 gpt-oss-20b openai
55%
3.85 $0.01
65 qwen3.6-27b qwen
54%
3.5 $0.05
66 qwen3.7-flash qwen
53%
3.68 $0.00
67 deepseek-v4-flash deepseek
52%
3.52 $0.00
68 gemini-3-flash-preview google
52%
3.46 $0.02
69 qwen3.5-122b-a10b qwen
52%
3.56 $0.14
70 qwen3.5-27b qwen
51%
3.61 $0.06
71 mimo-v2.5 xiaomi
51%
3.67 $0.02
72 qwen3.6-flash qwen
50%
3.76 $0.06
73 gemma-4-26b-a4b-it google
49%
3.41 $0.01
74 glm-5.1 z-ai
48%
3.5 $0.08
75 glm-4.7 z-ai
46%
3.67 $0.07
76 minimax-m2.5 minimax
42%
4.24 $0.01
77 muse-spark-1.1 meta
38%
3.66 $0.05
78 qwen3.5-35b-a3b qwen
38%
3.79 $0.04
79 minimax-m3 minimax
35%
3.77 $0.05
80 qwen3.6-35b-a3b qwen
35%
3.49 $0.07
81 deepseek-v4-pro deepseek
25%
3.08 $0.08
82 minimax-m2.7 minimax
22%
4.14 $0.01
83 mistral-large-2512 mistralai
10%
3.7 $0.00
84 glm-4.7-flash z-ai
7%
4.0 $0.01
85 trinity-large-thinking arcee-ai
3%
2.67 $0.04

Hardest words to solve

Rank Word
1 WAFER
2 EXPEL
3 EAGER
4 BOOZY
5 PIPER
6 PROXY
7 GULLY
8 CATCH
9 VALUE
10 FIFTY

Models with most errors

Rank Model
1 trinity-large-thinking
2 glm-4.7-flash
3 deepseek-v4-pro
4 muse-spark-1.1
5 minimax-m3
6 qwen3.6-35b-a3b
7 gemma-4-26b-a4b-it
8 gemini-3-flash-preview
9 glm-5.1
10 deepseek-v4-flash