Wordle Bench

Evaluating LLMs on their Wordle-solving capabilities

Leaderboard

Rank Model Provider Success Rate Avg Guesses Avg Cost
1 gpt-5 openai
99%
3.59 $0.20
2 claude-sonnet-4.6 anthropic
98%
3.7 $0.14
3 gpt-5.4 openai
98%
3.57 $0.09
4 claude-fable-5 anthropic
97%
3.51 $0.18
5 gpt-5.5 openai
97%
3.57 $0.22
6 gpt-5.6-sol openai
97%
3.53 $0.07
7 qwen3.8-max qwen
97%
3.55 $0.25
8 claude-opus-5 anthropic
96%
3.6 $0.11
9 claude-sonnet-5 anthropic
96%
3.74 $0.04
10 gpt-5.6-terra-pro openai
96%
3.5 $0.12
11 qwen3.7-plus qwen
96%
3.66 $0.02
12 claude-opus-4.6 anthropic
95%
3.58 $0.14
13 gpt-5.1 openai
95%
3.6 $0.13
14 grok-4.20-beta x-ai
95%
3.68 $0.07
15 claude-opus-4.8 anthropic
94%
3.51 $0.08
16 gemini-3-pro-preview google
94%
3.53 $0.14
17 gpt-5-mini openai
94%
3.62 $0.04
18 gpt-5.6-luna openai
94%
3.69 $0.01
19 gpt-5.6-sol-pro openai
94%
3.5 $0.34
20 claude-opus-4.5 anthropic
93%
3.62 $0.29
21 gemini-3.1-flash-lite-preview google
93%
3.69 $0.01
22 qwen3.7-max qwen
92%
3.53 $0.06
23 grok-4.5 x-ai
92%
3.62 $0.10
24 gpt-5.6-luna-pro openai
91%
3.54 $0.08
25 gpt-5.6-terra openai
91%
3.49 $0.03
26 qwen3.6-plus qwen
90%
3.56 $0.06
27 inkling-small thinkingmachines
90%
3.62 $0.01
28 gpt-5.4-mini openai
89%
3.72 $0.05
29 grok-4.1-fast x-ai
89%
3.73 $0.01
30 claude-opus-4.7 anthropic
87%
3.53 $0.10
31 claude-sonnet-4.5 anthropic
87%
3.63 $0.08
32 gemma-4-31b-it google
87%
3.56 $0.00
33 gpt-5.2 openai
87%
3.68 $0.03
34 gemini-3.6-flash google
86%
3.53 $0.07
35 kimi-k2.5 moonshotai
86%
3.59 $0.05
36 gpt-5.4-nano openai
86%
3.72 $0.01
37 qwen3-max-thinking qwen
86%
3.74 $0.24
38 gpt-5-nano openai
85%
3.69 $0.01
39 grok-4.3 x-ai
85%
3.74 $0.05
40 mimo-v2-flash xiaomi
85%
3.65 $0.00
41 mistral-medium-3-5 mistralai
84%
3.87 $0.30
42 qwen3-next-80b-a3b-thinking qwen
83%
3.69 $0.04
43 kimi-k2.6 moonshotai
81%
3.75 $0.21
44 mimo-v2-pro xiaomi
81%
3.77 $0.03
45 claude-haiku-4.5 anthropic
80%
3.71 $0.08
46 inkling thinkingmachines
80%
3.5 $0.09
47 mimo-v2.5-pro xiaomi
80%
3.76 $0.04
48 glm-5.2 z-ai
78%
3.74 $0.07
49 deepseek-v4-flash-0731 deepseek
77%
3.58 $0.00
50 gemini-3.1-pro-preview google
75%
3.64 $0.19
51 glm-5-turbo z-ai
75%
3.73 $0.03
52 gemini-3.5-flash-lite google
74%
3.58 $0.02
53 gemini-2.5-pro google
72%
3.6 $0.16
54 gpt-oss-120b openai
72%
3.74 $0.01
55 nemotron-3-ultra-550b-a55b nvidia
71%
3.79 $0.03
56 gemini-3.5-flash google
66%
3.44 $0.06
57 gemini-2.5-flash google
63%
3.83 $0.03
58 qwen3.5-397b-a17b qwen
63%
3.63 $0.08
59 glm-5 z-ai
63%
3.59 $0.06
60 mistral-small-2603 mistralai
61%
3.98 $0.01
61 kimi-k3 moonshotai
60%
3.57 $0.41
62 nemotron-3-nano-30b-a3b nvidia
58%
3.66 $0.01
63 gpt-oss-20b openai
55%
3.85 $0.01
64 qwen3.6-27b qwen
54%
3.5 $0.05
65 qwen3.7-flash qwen
53%
3.68 $0.00
66 deepseek-v4-flash deepseek
52%
3.52 $0.00
67 gemini-3-flash-preview google
52%
3.46 $0.02
68 qwen3.5-122b-a10b qwen
52%
3.56 $0.14
69 qwen3.5-27b qwen
51%
3.61 $0.06
70 mimo-v2.5 xiaomi
51%
3.67 $0.02
71 qwen3.6-flash qwen
50%
3.76 $0.06
72 gemma-4-26b-a4b-it google
49%
3.41 $0.01
73 glm-5.1 z-ai
48%
3.5 $0.08
74 glm-4.7 z-ai
46%
3.67 $0.07
75 minimax-m2.5 minimax
42%
4.24 $0.01
76 muse-spark-1.1 meta
38%
3.66 $0.05
77 qwen3.5-35b-a3b qwen
38%
3.79 $0.04
78 minimax-m3 minimax
35%
3.77 $0.05
79 qwen3.6-35b-a3b qwen
35%
3.49 $0.07
80 deepseek-v4-pro deepseek
25%
3.08 $0.08
81 minimax-m2.7 minimax
22%
4.14 $0.01
82 mistral-large-2512 mistralai
10%
3.7 $0.00
83 glm-4.7-flash z-ai
7%
4.0 $0.01
84 trinity-large-thinking arcee-ai
3%
2.67 $0.04

Hardest words to solve

Rank Word
1 WAFER
2 EXPEL
3 EAGER
4 PIPER
5 BOOZY
6 PROXY
7 GULLY
8 CATCH
9 VALUE
10 FIFTY

Models with most errors

Rank Model
1 trinity-large-thinking
2 glm-4.7-flash
3 deepseek-v4-pro
4 muse-spark-1.1
5 minimax-m3
6 qwen3.6-35b-a3b
7 gemma-4-26b-a4b-it
8 gemini-3-flash-preview
9 glm-5.1
10 deepseek-v4-flash