Anthropic / claude-sonnet-4.6
none
91.7%
187 / 204 fixtures · 1 run(s)
39,516 input / 11,885 total output / 0 reasoning within output tokens $0.29682300
Reliability by Benchmark (Text)
Loading reliability summary…
Text vs JSON Schema Comparison
Pass Rate Delta
+0.5%
Text: 91.7% →
JSON: 92.2%
+9
Gained
JSON pass / text fail
−8
Lost
Text pass / JSON fail
179
Unchanged Pass
Both pass
8
Unchanged Fail
Both fail
Fixture Reliability Delta
| Fixture | Text | JSON | Delta |
|---|---|---|---|
| f009 | 0% (0/1) | 100% (1/1) | -100% |
Benchmark Deltas
| Benchmark | Text | JSON | Delta |
|---|---|---|---|
| branch_cleanup | 100% | 75% | -25% |
| git_grep | 83.3% | 91.7% | + 8.3% |
| blame_forensics | 91.7% | 100% | + 8.3% |
| commit_messages | 91.7% | 100% | + 8.3% |
| git_show | 91.7% | 100% | + 8.3% |
| rebase | 83.3% | 75% | -8.3% |
| reflog | 100% | 91.7% | -8.3% |
| submodule_usage | 91.7% | 100% | + 8.3% |
| worktree_usage | 91.7% | 100% | + 8.3% |
| cherry_pick | 75% | 75% | + 0% |
| commit_squash | 91.7% | 91.7% | + 0% |
| git_bisect | 100% | 100% | + 0% |
| git_clean | 83.3% | 83.3% | + 0% |
| git_log_format | 100% | 100% | + 0% |
| merge_conflicts | 83.3% | 83.3% | + 0% |
| stash_recovery | 100% | 100% | + 0% |
| tag_management | 100% | 100% | + 0% |
Changed Fixtures (17)
Fixture Gallery (204)
blame_forensics f001
100%
Passed
Tokens
246
Input
9
Total output
0
Reasoning within output
blame_forensics f002
100%
Passed
Tokens
228
Input
8
Total output
0
Reasoning within output
blame_forensics f003
100%
Passed
Tokens
267
Input
9
Total output
0
Reasoning within output
blame_forensics f004
100%
Passed
Tokens
193
Input
8
Total output
0
Reasoning within output
blame_forensics f005
0%
Failed
Tokens
244
Input
9
Total output
0
Reasoning within output
blame_forensics f006
100%
Passed
Tokens
231
Input
6
Total output
0
Reasoning within output
blame_forensics f007
100%
Passed
Tokens
199
Input
8
Total output
0
Reasoning within output
blame_forensics f008
100%
Passed
Tokens
240
Input
8
Total output
0
Reasoning within output
blame_forensics f009
100%
Passed
Tokens
197
Input
8
Total output
0
Reasoning within output
blame_forensics f010
100%
Passed
Tokens
406
Input
6
Total output
0
Reasoning within output
blame_forensics f011
100%
Passed
Tokens
235
Input
6
Total output
0
Reasoning within output
blame_forensics f012
100%
Passed
Tokens
150
Input
9
Total output
0
Reasoning within output
branch_cleanup f001
100%
Passed
Tokens
110
Input
7
Total output
0
Reasoning within output
branch_cleanup f002
100%
Passed
Tokens
122
Input
10
Total output
0
Reasoning within output
branch_cleanup f003
100%
Passed
Tokens
100
Input
4
Total output
0
Reasoning within output
branch_cleanup f004
100%
Passed
Tokens
136
Input
10
Total output
0
Reasoning within output
branch_cleanup f005
100%
Passed
Tokens
109
Input
7
Total output
0
Reasoning within output
branch_cleanup f006
100%
Passed
Tokens
127
Input
11
Total output
0
Reasoning within output
branch_cleanup f007
100%
Passed
Tokens
107
Input
10
Total output
0
Reasoning within output
branch_cleanup f008
100%
Passed
Tokens
125
Input
12
Total output
0
Reasoning within output
branch_cleanup f009
100%
Passed
Tokens
87
Input
4
Total output
0
Reasoning within output
branch_cleanup f010
100%
Passed
Tokens
123
Input
8
Total output
0
Reasoning within output
branch_cleanup f011
100%
Passed
Tokens
74
Input
4
Total output
0
Reasoning within output
branch_cleanup f012
100%
Passed
Tokens
163
Input
15
Total output
0
Reasoning within output
cherry_pick f001
100%
Passed
Tokens
108
Input
7
Total output
0
Reasoning within output
cherry_pick f002
100%
Passed
Tokens
130
Input
10
Total output
0
Reasoning within output
cherry_pick f003
100%
Passed
Tokens
100
Input
7
Total output
0
Reasoning within output
cherry_pick f004
0%
Failed
Tokens
161
Input
28
Total output
0
Reasoning within output
cherry_pick f005
100%
Passed
Tokens
170
Input
29
Total output
0
Reasoning within output
cherry_pick f006
100%
Passed
Tokens
146
Input
28
Total output
0
Reasoning within output
cherry_pick f007
100%
Passed
Tokens
143
Input
16
Total output
0
Reasoning within output
cherry_pick f008
100%
Passed
Tokens
135
Input
13
Total output
0
Reasoning within output
cherry_pick f009
100%
Passed
Tokens
123
Input
9
Total output
0
Reasoning within output
cherry_pick f010
50%
Failed
Tokens
236
Input
31
Total output
0
Reasoning within output
cherry_pick f011
100%
Passed
Tokens
182
Input
32
Total output
0
Reasoning within output
cherry_pick f012
0%
Failed
Tokens
292
Input
56
Total output
0
Reasoning within output
commit_messages f001
81.3%
Passed
Tokens
118
Input
13
Total output
0
Reasoning within output
commit_messages f002
86%
Passed
Tokens
238
Input
8
Total output
0
Reasoning within output
commit_messages f003
88.3%
Passed
Tokens
94
Input
16
Total output
0
Reasoning within output
commit_messages f004
91.3%
Passed
Tokens
123
Input
9
Total output
0
Reasoning within output
commit_messages f005
91%
Passed
Tokens
117
Input
10
Total output
0
Reasoning within output
commit_messages f006
92.7%
Passed
Tokens
149
Input
11
Total output
0
Reasoning within output
commit_messages f007
87.7%
Passed
Tokens
211
Input
14
Total output
0
Reasoning within output
commit_messages f008
92.7%
Passed
Tokens
79
Input
10
Total output
0
Reasoning within output
commit_messages f009
40%
Failed
Tokens
142
Input
17
Total output
0
Reasoning within output
commit_messages f010
89.3%
Passed
Tokens
321
Input
10
Total output
0
Reasoning within output
commit_messages f011
73.3%
Passed
Tokens
165
Input
15
Total output
0
Reasoning within output
commit_messages f012
93.3%
Passed
Tokens
142
Input
8
Total output
0
Reasoning within output
commit_squash f001
100%
Passed
Tokens
143
Input
16
Total output
0
Reasoning within output
commit_squash f002
100%
Passed
Tokens
122
Input
13
Total output
0
Reasoning within output
commit_squash f003
100%
Passed
Tokens
135
Input
16
Total output
0
Reasoning within output
commit_squash f004
100%
Passed
Tokens
120
Input
14
Total output
0
Reasoning within output
commit_squash f005
0%
Failed
Tokens
117
Input
23
Total output
0
Reasoning within output
commit_squash f006
100%
Passed
Tokens
107
Input
15
Total output
0
Reasoning within output
commit_squash f007
100%
Passed
Tokens
107
Input
15
Total output
0
Reasoning within output
commit_squash f008
100%
Passed
Tokens
117
Input
15
Total output
0
Reasoning within output
commit_squash f009
100%
Passed
Tokens
113
Input
14
Total output
0
Reasoning within output
commit_squash f010
100%
Passed
Tokens
124
Input
18
Total output
0
Reasoning within output
commit_squash f011
100%
Passed
Tokens
135
Input
18
Total output
0
Reasoning within output
commit_squash f012
100%
Passed
Tokens
127
Input
23
Total output
0
Reasoning within output
git_bisect f001
100%
Passed
Tokens
180
Input
13
Total output
0
Reasoning within output
git_bisect f002
100%
Passed
Tokens
211
Input
52
Total output
0
Reasoning within output
git_bisect f003
100%
Passed
Tokens
207
Input
124
Total output
0
Reasoning within output
git_bisect f004
100%
Passed
Tokens
207
Input
41
Total output
0
Reasoning within output
git_bisect f005
100%
Passed
Tokens
215
Input
66
Total output
0
Reasoning within output
git_bisect f006
100%
Passed
Tokens
246
Input
14
Total output
0
Reasoning within output
git_bisect f007
100%
Passed
Tokens
211
Input
50
Total output
0
Reasoning within output
git_bisect f008
100%
Passed
Tokens
207
Input
138
Total output
0
Reasoning within output
git_bisect f009
100%
Passed
Tokens
205
Input
14
Total output
0
Reasoning within output
git_bisect f010
100%
Passed
Tokens
209
Input
14
Total output
0
Reasoning within output
git_bisect f011
100%
Passed
Tokens
209
Input
14
Total output
0
Reasoning within output
git_bisect f012
100%
Passed
Tokens
230
Input
29
Total output
0
Reasoning within output
git_clean f001
100%
Passed
Tokens
61
Input
13
Total output
0
Reasoning within output
git_clean f002
100%
Passed
Tokens
74
Input
11
Total output
0
Reasoning within output
git_clean f003
100%
Passed
Tokens
73
Input
11
Total output
0
Reasoning within output
git_clean f004
100%
Passed
Tokens
73
Input
12
Total output
0
Reasoning within output
git_clean f005
50%
Failed
Tokens
59
Input
52
Total output
0
Reasoning within output
git_clean f006
100%
Passed
Tokens
93
Input
13
Total output
0
Reasoning within output
git_clean f007
100%
Passed
Tokens
85
Input
17
Total output
0
Reasoning within output
git_clean f008
100%
Passed
Tokens
94
Input
11
Total output
0
Reasoning within output
git_clean f009
100%
Passed
Tokens
85
Input
15
Total output
0
Reasoning within output
git_clean f010
100%
Passed
Tokens
75
Input
11
Total output
0
Reasoning within output
git_clean f011
60%
Failed
Tokens
77
Input
12
Total output
0
Reasoning within output
git_clean f012
100%
Passed
Tokens
79
Input
14
Total output
0
Reasoning within output
git_grep f001
100%
Passed
Tokens
59
Input
8
Total output
0
Reasoning within output
git_grep f002
100%
Passed
Tokens
67
Input
5
Total output
0
Reasoning within output
git_grep f003
100%
Passed
Tokens
109
Input
5
Total output
0
Reasoning within output
git_grep f004
100%
Passed
Tokens
86
Input
9
Total output
0
Reasoning within output
git_grep f005
100%
Passed
Tokens
125
Input
5
Total output
0
Reasoning within output
git_grep f006
0%
Failed
Tokens
43
Input
28
Total output
0
Reasoning within output
git_grep f007
0%
Failed
Tokens
186
Input
214
Total output
0
Reasoning within output
git_grep f008
100%
Passed
Tokens
64
Input
5
Total output
0
Reasoning within output
git_grep f009
100%
Passed
Tokens
58
Input
7
Total output
0
Reasoning within output
git_grep f010
100%
Passed
Tokens
72
Input
5
Total output
0
Reasoning within output
git_grep f011
100%
Passed
Tokens
136
Input
5
Total output
0
Reasoning within output
git_grep f012
100%
Passed
Tokens
74
Input
16
Total output
0
Reasoning within output
git_log_format f001
100%
Passed
Tokens
800
Input
5
Total output
0
Reasoning within output
git_log_format f002
100%
Passed
Tokens
786
Input
10
Total output
0
Reasoning within output
git_log_format f003
100%
Passed
Tokens
646
Input
13
Total output
0
Reasoning within output
git_log_format f004
100%
Passed
Tokens
795
Input
5
Total output
0
Reasoning within output
git_log_format f005
100%
Passed
Tokens
647
Input
8
Total output
0
Reasoning within output
git_log_format f006
100%
Passed
Tokens
799
Input
5
Total output
0
Reasoning within output
git_log_format f007
100%
Passed
Tokens
802
Input
8
Total output
0
Reasoning within output
git_log_format f008
100%
Passed
Tokens
1,086
Input
5
Total output
0
Reasoning within output
git_log_format f009
100%
Passed
Tokens
650
Input
5
Total output
0
Reasoning within output
git_log_format f010
100%
Passed
Tokens
1,186
Input
5
Total output
0
Reasoning within output
git_log_format f011
100%
Passed
Tokens
409
Input
6
Total output
0
Reasoning within output
git_log_format f012
100%
Passed
Tokens
363
Input
5
Total output
0
Reasoning within output
git_show f001
100%
Passed
Tokens
186
Input
8
Total output
0
Reasoning within output
git_show f002
100%
Passed
Tokens
204
Input
6
Total output
0
Reasoning within output
git_show f003
100%
Passed
Tokens
668
Input
9
Total output
0
Reasoning within output
git_show f004
100%
Passed
Tokens
440
Input
9
Total output
0
Reasoning within output
git_show f005
0%
Failed
Tokens
206
Input
37
Total output
0
Reasoning within output
git_show f006
100%
Passed
Tokens
215
Input
5
Total output
0
Reasoning within output
git_show f007
100%
Passed
Tokens
191
Input
8
Total output
0
Reasoning within output
git_show f008
100%
Passed
Tokens
208
Input
28
Total output
0
Reasoning within output
git_show f009
100%
Passed
Tokens
300
Input
5
Total output
0
Reasoning within output
git_show f010
100%
Passed
Tokens
200
Input
4
Total output
0
Reasoning within output
git_show f011
100%
Passed
Tokens
226
Input
6
Total output
0
Reasoning within output
git_show f012
100%
Passed
Tokens
355
Input
5
Total output
0
Reasoning within output
merge_conflicts f001
100%
Passed
Tokens
98
Input
7
Total output
0
Reasoning within output
merge_conflicts f002
100%
Passed
Tokens
116
Input
10
Total output
0
Reasoning within output
merge_conflicts f003
100%
Passed
Tokens
91
Input
11
Total output
0
Reasoning within output
merge_conflicts f004
100%
Passed
Tokens
148
Input
30
Total output
0
Reasoning within output
merge_conflicts f005
100%
Passed
Tokens
156
Input
29
Total output
0
Reasoning within output
merge_conflicts f006
100%
Passed
Tokens
133
Input
28
Total output
0
Reasoning within output
merge_conflicts f007
100%
Passed
Tokens
146
Input
16
Total output
0
Reasoning within output
merge_conflicts f008
0%
Failed
Tokens
120
Input
23
Total output
0
Reasoning within output
merge_conflicts f009
100%
Passed
Tokens
120
Input
9
Total output
0
Reasoning within output
merge_conflicts f010
100%
Passed
Tokens
203
Input
41
Total output
0
Reasoning within output
merge_conflicts f011
100%
Passed
Tokens
159
Input
32
Total output
0
Reasoning within output
merge_conflicts f012
0%
Failed
Tokens
255
Input
56
Total output
0
Reasoning within output
rebase f001
100%
Passed
Tokens
108
Input
7
Total output
0
Reasoning within output
rebase f002
100%
Passed
Tokens
137
Input
10
Total output
0
Reasoning within output
rebase f003
100%
Passed
Tokens
115
Input
6
Total output
0
Reasoning within output
rebase f004
100%
Passed
Tokens
161
Input
30
Total output
0
Reasoning within output
rebase f005
100%
Passed
Tokens
161
Input
25
Total output
0
Reasoning within output
rebase f006
100%
Passed
Tokens
146
Input
28
Total output
0
Reasoning within output
rebase f007
100%
Passed
Tokens
149
Input
16
Total output
0
Reasoning within output
rebase f008
100%
Passed
Tokens
134
Input
9
Total output
0
Reasoning within output
rebase f009
100%
Passed
Tokens
120
Input
9
Total output
0
Reasoning within output
rebase f010
50%
Failed
Tokens
230
Input
41
Total output
0
Reasoning within output
rebase f011
100%
Passed
Tokens
171
Input
32
Total output
0
Reasoning within output
rebase f012
0%
Failed
Tokens
290
Input
56
Total output
0
Reasoning within output
reflog f001
100%
Passed
Tokens
212
Input
26
Total output
0
Reasoning within output
reflog f002
100%
Passed
Tokens
209
Input
470
Total output
0
Reasoning within output
reflog f003
100%
Passed
Tokens
194
Input
626
Total output
0
Reasoning within output
reflog f004
100%
Passed
Tokens
288
Input
707
Total output
0
Reasoning within output
reflog f005
100%
Passed
Tokens
342
Input
369
Total output
0
Reasoning within output
reflog f006
100%
Passed
Tokens
222
Input
455
Total output
0
Reasoning within output
reflog f007
100%
Passed
Tokens
251
Input
553
Total output
0
Reasoning within output
reflog f008
100%
Passed
Tokens
317
Input
366
Total output
0
Reasoning within output
reflog f009
100%
Passed
Tokens
279
Input
576
Total output
0
Reasoning within output
reflog f010
100%
Passed
Tokens
242
Input
434
Total output
0
Reasoning within output
reflog f011
100%
Passed
Tokens
297
Input
500
Total output
0
Reasoning within output
reflog f012
100%
Passed
Tokens
281
Input
556
Total output
0
Reasoning within output
stash_recovery f001
100%
Passed
Tokens
157
Input
154
Total output
0
Reasoning within output
stash_recovery f002
100%
Passed
Tokens
328
Input
217
Total output
0
Reasoning within output
stash_recovery f003
100%
Passed
Tokens
140
Input
297
Total output
0
Reasoning within output
stash_recovery f004
100%
Passed
Tokens
138
Input
196
Total output
0
Reasoning within output
stash_recovery f005
100%
Passed
Tokens
154
Input
293
Total output
0
Reasoning within output
stash_recovery f006
100%
Passed
Tokens
209
Input
310
Total output
0
Reasoning within output
stash_recovery f007
100%
Passed
Tokens
238
Input
207
Total output
0
Reasoning within output
stash_recovery f008
100%
Passed
Tokens
202
Input
230
Total output
0
Reasoning within output
stash_recovery f009
100%
Passed
Tokens
244
Input
311
Total output
0
Reasoning within output
stash_recovery f010
100%
Passed
Tokens
150
Input
213
Total output
0
Reasoning within output
stash_recovery f011
100%
Passed
Tokens
136
Input
155
Total output
0
Reasoning within output
stash_recovery f012
100%
Passed
Tokens
159
Input
251
Total output
0
Reasoning within output
submodule_usage f001
100%
Passed
Tokens
48
Input
17
Total output
0
Reasoning within output
submodule_usage f002
100%
Passed
Tokens
108
Input
18
Total output
0
Reasoning within output
submodule_usage f003
100%
Passed
Tokens
115
Input
41
Total output
0
Reasoning within output
submodule_usage f004
0%
Failed
Tokens
98
Input
12
Total output
0
Reasoning within output
submodule_usage f005
100%
Passed
Tokens
55
Input
42
Total output
0
Reasoning within output
submodule_usage f006
100%
Passed
Tokens
96
Input
12
Total output
0
Reasoning within output
submodule_usage f007
100%
Passed
Tokens
58
Input
28
Total output
0
Reasoning within output
submodule_usage f008
100%
Passed
Tokens
105
Input
15
Total output
0
Reasoning within output
submodule_usage f009
100%
Passed
Tokens
100
Input
12
Total output
0
Reasoning within output
submodule_usage f010
100%
Passed
Tokens
108
Input
15
Total output
0
Reasoning within output
submodule_usage f011
100%
Passed
Tokens
114
Input
8
Total output
0
Reasoning within output
submodule_usage f012
100%
Passed
Tokens
56
Input
20
Total output
0
Reasoning within output
tag_management f001
100%
Passed
Tokens
62
Input
13
Total output
0
Reasoning within output
tag_management f002
100%
Passed
Tokens
61
Input
26
Total output
0
Reasoning within output
tag_management f003
100%
Passed
Tokens
65
Input
17
Total output
0
Reasoning within output
tag_management f004
100%
Passed
Tokens
68
Input
9
Total output
0
Reasoning within output
tag_management f005
100%
Passed
Tokens
86
Input
16
Total output
0
Reasoning within output
tag_management f006
100%
Passed
Tokens
69
Input
20
Total output
0
Reasoning within output
tag_management f007
100%
Passed
Tokens
66
Input
18
Total output
0
Reasoning within output
tag_management f008
100%
Passed
Tokens
73
Input
49
Total output
0
Reasoning within output
tag_management f009
100%
Passed
Tokens
81
Input
25
Total output
0
Reasoning within output
tag_management f010
100%
Passed
Tokens
51
Input
14
Total output
0
Reasoning within output
tag_management f011
100%
Passed
Tokens
54
Input
12
Total output
0
Reasoning within output
tag_management f012
100%
Passed
Tokens
88
Input
15
Total output
0
Reasoning within output
worktree_usage f001
100%
Passed
Tokens
144
Input
18
Total output
0
Reasoning within output
worktree_usage f002
100%
Passed
Tokens
150
Input
34
Total output
0
Reasoning within output
worktree_usage f003
100%
Passed
Tokens
210
Input
15
Total output
0
Reasoning within output
worktree_usage f004
0%
Failed
Tokens
222
Input
10
Total output
0
Reasoning within output
worktree_usage f005
100%
Passed
Tokens
138
Input
21
Total output
0
Reasoning within output
worktree_usage f006
100%
Passed
Tokens
141
Input
24
Total output
0
Reasoning within output
worktree_usage f007
100%
Passed
Tokens
144
Input
34
Total output
0
Reasoning within output
worktree_usage f008
100%
Passed
Tokens
174
Input
66
Total output
0
Reasoning within output
worktree_usage f009
100%
Passed
Tokens
255
Input
11
Total output
0
Reasoning within output
worktree_usage f010
100%
Passed
Tokens
218
Input
23
Total output
0
Reasoning within output
worktree_usage f011
100%
Passed
Tokens
215
Input
15
Total output
0
Reasoning within output
worktree_usage f012
100%
Passed
Tokens
141
Input
21
Total output
0
Reasoning within output