Little Dorrit benchmark rankings

Open the interactive leaderboard

Benchmark rankings

80 models. Latest benchmark run: . This snapshot is available without JavaScript.

All benchmark models, ordered by F1. Confidence intervals are calculated in the interactive view.
RankModel / route / shotsF195% CIPrecisionRecallEval dateDate released
1GPT-6 Astra · OpenRouter · 2-shot0.7778See interactive view0.75590.80102026-09-062026-09-03
2Claude Fable 5.1* · OpenRouter · 2-shot0.7316See interactive view0.70000.76622026-09-062026-09-01
3Claude Opus 5* · OpenRouter · 2-shot0.6904See interactive view0.66450.71852026-09-062026-07-24
4Claude Fable 5* · 2-shot0.6579See interactive view0.62740.69152026-07-232026-06-09
5Kimi K3 · OpenRouter · 2-shot0.6496See interactive view0.66840.63182026-07-232026-07-16
6GPT-5.4 · 2-shot0.6219See interactive view0.64520.60022026-03-052026-03-05
7Gemini 3.6 Flash · OpenRouter · 2-shot0.6197See interactive view0.61660.62282026-07-232026-07-21
8GPT-5.5 Pro · OpenRouter · 2-shot0.6078See interactive view0.59900.61692026-04-262026-04-24
9Muse Spark 1.3 · OpenRouter · 2-shot0.6078See interactive view0.59900.61692026-09-102026-09-02
10Gemini 3.8 Flash* · OpenRouter · 2-shot0.5954See interactive view0.60940.58212026-09-062026-09-02
11GPT-5.5 · 2-shot0.5820See interactive view0.57770.58642026-04-262026-04-23
12GPT-5.6 Sol · 2-shot0.5811See interactive view0.56600.59702026-07-232026-07-09
13Kimi K2.6 Nitro · OpenRouter · 2-shot0.5714See interactive view0.63170.52172026-04-262026-04-20
14GPT-5.3 Codex · OpenRouter · 2-shot0.5699See interactive view0.61050.53442026-03-052026-02-05
15Grok 4.6 · OpenRouter · 2-shot0.5521See interactive view0.53770.56722026-09-062026-08-12
16Claude Sonnet 5* · 2-shot0.5347See interactive view0.54750.52252026-07-232026-06-30
17GPT-5.6 Terra · 2-shot0.5284See interactive view0.54670.51132026-07-232026-07-09
18Gemini 3.5 Flash · OpenRouter · 2-shot0.5250See interactive view0.52770.52242026-07-232026-05-19
19GPT-5.6 Luna · 2-shot0.5076See interactive view0.51810.49752026-07-232026-07-09
20Muse Spark 1.1 · OpenRouter · 2-shot0.4875See interactive view0.49370.48152026-07-232026-07-16
21Claude Opus 4.7* · 2-shot0.4805See interactive view0.48820.47302026-04-262026-04-16
22GPT-5.2 · OpenRouter · 2-shot0.4791See interactive view0.52970.43742026-02-222025-12-11
23Kimi K2.5 · OpenRouter · 2-shot0.4751See interactive view0.50920.44532026-02-222025-07-11
24Kimi K2.7 Code · OpenRouter · 2-shot0.4611See interactive view0.55060.39662026-07-232026-06-12
25Grok 4.5 · OpenRouter · 2-shot0.4416See interactive view0.44500.43822026-07-232026-07-08
26Claude Opus 4.5* · 2-shot0.4141See interactive view0.40900.41942026-03-08Nov 2025
27GPT-5 · 2-shot0.4067See interactive view0.48380.35082026-02-182025-08-07
28Qwen3.6 Plus Nitro · OpenRouter · 2-shot0.3797See interactive view0.46780.31952026-04-262026-04-02
29Qwen3.8 Max (0902)* · OpenRouter · 2-shot0.3725See interactive view0.36400.38142026-09-062026-09-03
30Muse Glimmer 30B · OpenRouter · 2-shot0.3663See interactive view0.41640.32692026-09-102026-08-09
31Qwen3.7 Plus · OpenRouter · 2-shot0.3575See interactive view0.36530.35002026-07-232026-05-31
32Claude Opus 4.6* · 2-shot0.3269See interactive view0.32440.32942026-03-082026-02-05
33Qwen3.5 397B A17B · OpenRouter · 2-shot0.3081See interactive view0.32480.29302026-02-222026-02-17
34Claude Sonnet 4.6* · 2-shot0.2882See interactive view0.31300.26702026-03-082026-02-17
35Gemini 3.1 Pro Preview · OpenRouter · 2-shot0.2493See interactive view0.24340.25542026-02-222026-02-19
36Claude Opus 4.1* · 2-shot0.2318See interactive view0.22360.24072026-03-082025-08-05
37Claude Opus 4.8* · 2-shot0.2150See interactive view0.21130.21882026-07-232026-05-28
38GPT-4o · 2-shot0.2123See interactive view0.25890.17992026-02-222024-05-13
39GPT-4o (2024-11-20 OR) · OpenRouter · 2-shot0.2085See interactive view0.26620.17132026-02-222024-11-20
40Inkling · OpenRouter · 2-shot0.1962See interactive view0.22480.17412026-07-232026-07-17
41GPT-5.3 Chat · 2-shot0.1958See interactive view0.21210.18182026-03-052026-03-03
42GPT-o4 Mini · 2-shot0.1895See interactive view0.23820.15732026-02-222025-04-16
43GPT-4.1 · 2-shot0.1773See interactive view0.22430.14652026-02-222025-04-14
44ChatGPT-4o · OpenRouter · 2-shot0.1726See interactive view0.20430.14942026-02-222024-05-13
45Step 3.7 Flash · OpenRouter · 2-shot0.1652See interactive view0.15870.17232026-07-232026-05-28
46GPT-4.5 Preview · OpenRouter · 2-shot0.1443See interactive view0.14240.14622026-02-222025-02-27
47Gemini 3.1 Flash Lite Preview · OpenRouter · 2-shot0.1354See interactive view0.15150.12242026-03-082026-03-03
48GPT-4.5 Preview · 2-shot0.1225See interactive view0.12090.12402026-02-222025-02-27
49Gemma 4 31B · OpenRouter · 2-shot0.1200See interactive view0.16160.09552026-04-042026-04-02
50Gemini 3.5 Flash Lite · OpenRouter · 2-shot0.1187See interactive view0.12430.11362026-07-232026-07-21
51Claude Sonnet 4.5* · 2-shot0.0986See interactive view0.08740.11302026-03-082025-09-29
52Mistral Medium 3.5 · OpenRouter · 2-shot0.0871See interactive view0.07330.10722026-07-232026-04-30
53GLM 4.6V · OpenRouter · 2-shot0.0837See interactive view0.14470.05882026-02-222025-12-08
54MiniMax M3 · OpenRouter · 2-shot0.0734See interactive view0.09410.06022026-07-232026-05-28
55DeepSeek V4 Flash Vision Exp* · OpenRouter · 2-shot0.0578See interactive view0.10550.03982026-09-062026-08-21
56Llama 4 Maverick · OpenRouter · 2-shot0.0485See interactive view0.05250.04512026-02-222025-04-05
57Claude Haiku 4.5* · 2-shot0.0459See interactive view0.05540.03922026-03-082025-10-15
58Mistral Small 3.1 24B · OpenRouter · 2-shot0.0443See interactive view0.05110.03912026-02-222025-03-17
59GPT-4 Turbo · 2-shot0.0437See interactive view0.05610.03582026-02-222023-11-06
60GPT-4o · OpenRouter · 2-shot0.0397See interactive view0.04960.03312026-02-222023-11-06
61GPT-4.1 Mini · 2-shot0.0354See interactive view0.03800.03322026-02-222025-04-14
62Gemma 3 27B · OpenRouter · 2-shot0.0341See interactive view0.03550.03292026-02-222025-03-12
63Qwen VL Max · OpenRouter · 2-shot0.0335See interactive view0.04340.02732026-02-222024-01-25
64GPT-4o Mini · 2-shot0.0299See interactive view0.03140.02852026-02-222024-07-18
65Qwen2.5 VL 72B Instruct · OpenRouter · 2-shot0.0208See interactive view0.02710.01692026-02-222025-01-26
66Google: Gemini 2.0 Flash · OpenRouter · 2-shot0.0183See interactive view0.02360.01492026-02-222025-02-05
67Llama 4 Scout · OpenRouter · 2-shot0.0169See interactive view0.02270.01342026-02-222025-04-05
68Gemma 4 26B A4B IT · OpenRouter · 2-shot0.0126See interactive view0.01570.01052026-04-042026-04-02
69GPT-4o-mini · OpenRouter · 2-shot0.0076See interactive view0.00850.00692026-02-222024-07-18
70Mistral Large 3 2512 · OpenRouter · 2-shot0.0072See interactive view0.00650.00802026-02-222025-12-02
71GPT-4.1 Nano · 2-shot0.0051See interactive view0.00580.00452026-02-222025-04-14
72DeepSeek R1 · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222025-01-20
73DeepSeek V3 0324 · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222025-03-25
74Gemini 2.5 Pro Preview 3/25 · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222025-03-25
75Grok 4 · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222025-07-09
76Grok 4 Fast · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222025-09-25
77Grok 4.1 Fast · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222026-01-29
78Llama 3.2 90B Vision Instruct · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222024-09-25
79Phi 4 Multimodal Instruct · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-22Feb 2025
80Qwen VL Plus · OpenRouter · 2-shot0.0000See interactive view0.00000.00002026-02-222024-01-25

Scores pool edit-level true positives, false positives, and false negatives across evaluated pages and runs. Higher is better. Small score differences may not be meaningful; use the interactive F1 confidence intervals when comparing models.

* Claude-family images are resized and recompressed as needed for Anthropic’s image limit. Other model-specific caveats appear in the interactive view.

Model-specific caveats
  • Claude Fable 5.1* · OpenRouter · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Opus 5* · OpenRouter · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Fable 5* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Gemini 3.8 Flash* · OpenRouter · 2-shot: Images are resized/recompressed when needed to stay below the provider's request payload limit.
  • Claude Sonnet 5* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Opus 4.7* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Opus 4.5* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Qwen3.8 Max (0902)* · OpenRouter · 2-shot: Images are resized/recompressed when needed to stay below the provider's request payload limit.
  • Claude Opus 4.6* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Sonnet 4.6* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Opus 4.1* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • Claude Opus 4.8* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit. Opus 4.8's score is depressed by unreliable line counting: it identifies most edits correctly (166 of ~200 match ground truth by text) but reports noisy line numbers that drift progressively down the page and vary between runs, so the judge rejects the matches.
  • Claude Sonnet 4.5* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.
  • DeepSeek V4 Flash Vision Exp* · OpenRouter · 2-shot: Incomplete run: 35 of 36 evaluation predictions completed; one request repeatedly timed out at the provider.
  • Claude Haiku 4.5* · 2-shot: Claude results use resized/recompressed images when needed to stay below Anthropic's 5 MiB per-image limit.

Interactive leaderboard · Rankings and pricing in Markdown · Raw results JSON · Pricing JSON · Technical report