X-ai / grok-4.3
none
80.9%
165 / 204 fixtures · 1 run(s)
69,737 input / 3,192 total output / 0 reasoning within output tokens $0.06706165
Reliability by Benchmark (Text)
Loading reliability summary…
Text vs JSON Schema Comparison
Pass Rate Delta
+4.9%
Text: 80.9% →
JSON: 85.8%
+20
Gained
JSON pass / text fail
−10
Lost
Text pass / JSON fail
155
Unchanged Pass
Both pass
19
Unchanged Fail
Both fail
Fixture Reliability Delta
| Fixture | Text | JSON | Delta |
|---|---|---|---|
| f011 | 100% (1/1) | 0% (0/1) | +100% |
Benchmark Deltas
| Benchmark | Text | JSON | Delta |
|---|---|---|---|
| blame_forensics | 25% | 91.7% | + 66.7% |
| commit_squash | 8.3% | 41.7% | + 33.3% |
| cherry_pick | 83.3% | 66.7% | -16.7% |
| git_grep | 83.3% | 91.7% | + 8.3% |
| git_show | 83.3% | 91.7% | + 8.3% |
| branch_cleanup | 75% | 66.7% | -8.3% |
| commit_messages | 100% | 91.7% | -8.3% |
| git_clean | 83.3% | 75% | -8.3% |
| merge_conflicts | 66.7% | 75% | + 8.3% |
| reflog | 100% | 91.7% | -8.3% |
| submodule_usage | 91.7% | 100% | + 8.3% |
| git_bisect | 100% | 100% | + 0% |
| git_log_format | 100% | 100% | + 0% |
| rebase | 83.3% | 83.3% | + 0% |
| stash_recovery | 100% | 100% | + 0% |
| tag_management | 91.7% | 91.7% | + 0% |
| worktree_usage | 100% | 100% | + 0% |
Changed Fixtures (30)
f002 +gain f005 +gain f007 +gain f008 +gain f009 +gain f010 +gain f011 +gain f012 +gain f002 +gain f003 -loss f005 +gain f009 -loss f011 -loss f002 -loss f007 -loss f011 -loss f002 -loss f003 +gain f007 +gain f008 +gain f009 +gain f010 +gain f007 -loss f006 +gain f005 +gain f003 +gain f001 -loss f003 +gain f008 -loss f012 +gain
Fixture Gallery (204)
blame_forensics f001
0%
Failed
Tokens
393
Input
8
Total output
0
Reasoning within output
blame_forensics f002
0%
Failed
Tokens
377
Input
8
Total output
0
Reasoning within output
blame_forensics f003
100%
Passed
Tokens
399
Input
6
Total output
0
Reasoning within output
blame_forensics f004
100%
Passed
Tokens
345
Input
5
Total output
0
Reasoning within output
blame_forensics f005
0%
Failed
Tokens
402
Input
8
Total output
0
Reasoning within output
blame_forensics f006
100%
Passed
Tokens
387
Input
3
Total output
0
Reasoning within output
blame_forensics f007
0%
Failed
Tokens
358
Input
9
Total output
0
Reasoning within output
blame_forensics f008
0%
Failed
Tokens
386
Input
116
Total output
0
Reasoning within output
blame_forensics f009
0%
Failed
Tokens
346
Input
6
Total output
0
Reasoning within output
blame_forensics f010
0%
Failed
Tokens
531
Input
9
Total output
0
Reasoning within output
blame_forensics f011
0%
Failed
Tokens
378
Input
7
Total output
0
Reasoning within output
blame_forensics f012
0%
Failed
Tokens
306
Input
10
Total output
0
Reasoning within output
branch_cleanup f001
0%
Failed
Tokens
273
Input
1
Total output
0
Reasoning within output
branch_cleanup f002
0%
Failed
Tokens
288
Input
1
Total output
0
Reasoning within output
branch_cleanup f003
100%
Passed
Tokens
268
Input
1
Total output
0
Reasoning within output
branch_cleanup f004
100%
Passed
Tokens
295
Input
5
Total output
0
Reasoning within output
branch_cleanup f005
0%
Failed
Tokens
278
Input
1
Total output
0
Reasoning within output
branch_cleanup f006
100%
Passed
Tokens
289
Input
7
Total output
0
Reasoning within output
branch_cleanup f007
100%
Passed
Tokens
272
Input
5
Total output
0
Reasoning within output
branch_cleanup f008
100%
Passed
Tokens
290
Input
9
Total output
0
Reasoning within output
branch_cleanup f009
100%
Passed
Tokens
253
Input
1
Total output
0
Reasoning within output
branch_cleanup f010
100%
Passed
Tokens
285
Input
5
Total output
0
Reasoning within output
branch_cleanup f011
100%
Passed
Tokens
242
Input
1
Total output
0
Reasoning within output
branch_cleanup f012
100%
Passed
Tokens
321
Input
10
Total output
0
Reasoning within output
cherry_pick f001
100%
Passed
Tokens
266
Input
4
Total output
0
Reasoning within output
cherry_pick f002
100%
Passed
Tokens
286
Input
10
Total output
0
Reasoning within output
cherry_pick f003
100%
Passed
Tokens
257
Input
3
Total output
0
Reasoning within output
cherry_pick f004
0%
Failed
Tokens
315
Input
24
Total output
0
Reasoning within output
cherry_pick f005
100%
Passed
Tokens
318
Input
20
Total output
0
Reasoning within output
cherry_pick f006
100%
Passed
Tokens
304
Input
24
Total output
0
Reasoning within output
cherry_pick f007
100%
Passed
Tokens
294
Input
8
Total output
0
Reasoning within output
cherry_pick f008
100%
Passed
Tokens
293
Input
6
Total output
0
Reasoning within output
cherry_pick f009
100%
Passed
Tokens
280
Input
5
Total output
0
Reasoning within output
cherry_pick f010
100%
Passed
Tokens
378
Input
24
Total output
0
Reasoning within output
cherry_pick f011
100%
Passed
Tokens
335
Input
21
Total output
0
Reasoning within output
cherry_pick f012
0%
Failed
Tokens
427
Input
37
Total output
0
Reasoning within output
commit_messages f001
90%
Passed
Tokens
274
Input
9
Total output
0
Reasoning within output
commit_messages f002
85%
Passed
Tokens
369
Input
9
Total output
0
Reasoning within output
commit_messages f003
93.3%
Passed
Tokens
256
Input
8
Total output
0
Reasoning within output
commit_messages f004
91.7%
Passed
Tokens
281
Input
3
Total output
0
Reasoning within output
commit_messages f005
92.7%
Passed
Tokens
272
Input
4
Total output
0
Reasoning within output
commit_messages f006
91%
Passed
Tokens
305
Input
6
Total output
0
Reasoning within output
commit_messages f007
91.7%
Passed
Tokens
342
Input
6
Total output
0
Reasoning within output
commit_messages f008
89.3%
Passed
Tokens
245
Input
4
Total output
0
Reasoning within output
commit_messages f009
87.7%
Passed
Tokens
296
Input
7
Total output
0
Reasoning within output
commit_messages f010
91%
Passed
Tokens
429
Input
7
Total output
0
Reasoning within output
commit_messages f011
53.3%
Passed
Tokens
314
Input
10
Total output
0
Reasoning within output
commit_messages f012
92%
Passed
Tokens
293
Input
5
Total output
0
Reasoning within output
commit_squash f001
0%
Failed
Tokens
305
Input
17
Total output
0
Reasoning within output
commit_squash f002
100%
Passed
Tokens
290
Input
8
Total output
0
Reasoning within output
commit_squash f003
0%
Failed
Tokens
292
Input
17
Total output
0
Reasoning within output
commit_squash f004
0%
Failed
Tokens
285
Input
17
Total output
0
Reasoning within output
commit_squash f005
0%
Failed
Tokens
287
Input
15
Total output
0
Reasoning within output
commit_squash f006
0%
Failed
Tokens
268
Input
17
Total output
0
Reasoning within output
commit_squash f007
0%
Failed
Tokens
270
Input
20
Total output
0
Reasoning within output
commit_squash f008
0%
Failed
Tokens
283
Input
17
Total output
0
Reasoning within output
commit_squash f009
0%
Failed
Tokens
272
Input
16
Total output
0
Reasoning within output
commit_squash f010
0%
Failed
Tokens
289
Input
21
Total output
0
Reasoning within output
commit_squash f011
0%
Failed
Tokens
298
Input
22
Total output
0
Reasoning within output
commit_squash f012
0%
Failed
Tokens
293
Input
29
Total output
0
Reasoning within output
git_bisect f001
100%
Passed
Tokens
339
Input
3
Total output
0
Reasoning within output
git_bisect f002
100%
Passed
Tokens
366
Input
4
Total output
0
Reasoning within output
git_bisect f003
100%
Passed
Tokens
364
Input
4
Total output
0
Reasoning within output
git_bisect f004
100%
Passed
Tokens
366
Input
44
Total output
0
Reasoning within output
git_bisect f005
100%
Passed
Tokens
368
Input
5
Total output
0
Reasoning within output
git_bisect f006
100%
Passed
Tokens
387
Input
4
Total output
0
Reasoning within output
git_bisect f007
100%
Passed
Tokens
366
Input
4
Total output
0
Reasoning within output
git_bisect f008
100%
Passed
Tokens
372
Input
5
Total output
0
Reasoning within output
git_bisect f009
100%
Passed
Tokens
364
Input
4
Total output
0
Reasoning within output
git_bisect f010
100%
Passed
Tokens
370
Input
4
Total output
0
Reasoning within output
git_bisect f011
100%
Passed
Tokens
360
Input
3
Total output
0
Reasoning within output
git_bisect f012
100%
Passed
Tokens
383
Input
3
Total output
0
Reasoning within output
git_clean f001
100%
Passed
Tokens
223
Input
7
Total output
0
Reasoning within output
git_clean f002
100%
Passed
Tokens
234
Input
6
Total output
0
Reasoning within output
git_clean f003
100%
Passed
Tokens
231
Input
4
Total output
0
Reasoning within output
git_clean f004
100%
Passed
Tokens
231
Input
8
Total output
0
Reasoning within output
git_clean f005
75%
Failed
Tokens
223
Input
13
Total output
0
Reasoning within output
git_clean f006
100%
Passed
Tokens
246
Input
6
Total output
0
Reasoning within output
git_clean f007
100%
Passed
Tokens
238
Input
9
Total output
0
Reasoning within output
git_clean f008
100%
Passed
Tokens
245
Input
4
Total output
0
Reasoning within output
git_clean f009
100%
Passed
Tokens
238
Input
7
Total output
0
Reasoning within output
git_clean f010
100%
Passed
Tokens
235
Input
6
Total output
0
Reasoning within output
git_clean f011
100%
Passed
Tokens
235
Input
5
Total output
0
Reasoning within output
git_clean f012
66.7%
Failed
Tokens
237
Input
6
Total output
0
Reasoning within output
git_grep f001
100%
Passed
Tokens
227
Input
3
Total output
0
Reasoning within output
git_grep f002
100%
Passed
Tokens
238
Input
1
Total output
0
Reasoning within output
git_grep f003
100%
Passed
Tokens
262
Input
1
Total output
0
Reasoning within output
git_grep f004
100%
Passed
Tokens
251
Input
5
Total output
0
Reasoning within output
git_grep f005
100%
Passed
Tokens
280
Input
1
Total output
0
Reasoning within output
git_grep f006
0%
Failed
Tokens
216
Input
1
Total output
0
Reasoning within output
git_grep f007
0%
Failed
Tokens
331
Input
1
Total output
0
Reasoning within output
git_grep f008
100%
Passed
Tokens
235
Input
1
Total output
0
Reasoning within output
git_grep f009
100%
Passed
Tokens
229
Input
3
Total output
0
Reasoning within output
git_grep f010
100%
Passed
Tokens
238
Input
1
Total output
0
Reasoning within output
git_grep f011
100%
Passed
Tokens
283
Input
1
Total output
0
Reasoning within output
git_grep f012
100%
Passed
Tokens
240
Input
8
Total output
0
Reasoning within output
git_log_format f001
100%
Passed
Tokens
856
Input
1
Total output
0
Reasoning within output
git_log_format f002
100%
Passed
Tokens
849
Input
7
Total output
0
Reasoning within output
git_log_format f003
100%
Passed
Tokens
729
Input
9
Total output
0
Reasoning within output
git_log_format f004
100%
Passed
Tokens
840
Input
1
Total output
0
Reasoning within output
git_log_format f005
100%
Passed
Tokens
737
Input
5
Total output
0
Reasoning within output
git_log_format f006
100%
Passed
Tokens
863
Input
1
Total output
0
Reasoning within output
git_log_format f007
100%
Passed
Tokens
873
Input
5
Total output
0
Reasoning within output
git_log_format f008
100%
Passed
Tokens
1,139
Input
1
Total output
0
Reasoning within output
git_log_format f009
100%
Passed
Tokens
725
Input
1
Total output
0
Reasoning within output
git_log_format f010
100%
Passed
Tokens
1,213
Input
1
Total output
0
Reasoning within output
git_log_format f011
100%
Passed
Tokens
513
Input
2
Total output
0
Reasoning within output
git_log_format f012
100%
Passed
Tokens
494
Input
1
Total output
0
Reasoning within output
git_show f001
100%
Passed
Tokens
338
Input
3
Total output
0
Reasoning within output
git_show f002
0%
Failed
Tokens
339
Input
2
Total output
0
Reasoning within output
git_show f003
100%
Passed
Tokens
726
Input
6
Total output
0
Reasoning within output
git_show f004
100%
Passed
Tokens
562
Input
6
Total output
0
Reasoning within output
git_show f005
0%
Failed
Tokens
346
Input
4
Total output
0
Reasoning within output
git_show f006
100%
Passed
Tokens
354
Input
1
Total output
0
Reasoning within output
git_show f007
100%
Passed
Tokens
339
Input
4
Total output
0
Reasoning within output
git_show f008
100%
Passed
Tokens
351
Input
21
Total output
0
Reasoning within output
git_show f009
100%
Passed
Tokens
438
Input
1
Total output
0
Reasoning within output
git_show f010
100%
Passed
Tokens
342
Input
1
Total output
0
Reasoning within output
git_show f011
100%
Passed
Tokens
367
Input
2
Total output
0
Reasoning within output
git_show f012
100%
Passed
Tokens
458
Input
1
Total output
0
Reasoning within output
merge_conflicts f001
0%
Failed
Tokens
257
Input
4
Total output
0
Reasoning within output
merge_conflicts f002
100%
Passed
Tokens
277
Input
7
Total output
0
Reasoning within output
merge_conflicts f003
0%
Failed
Tokens
250
Input
3
Total output
0
Reasoning within output
merge_conflicts f004
0%
Failed
Tokens
303
Input
22
Total output
0
Reasoning within output
merge_conflicts f005
100%
Passed
Tokens
306
Input
20
Total output
0
Reasoning within output
merge_conflicts f006
100%
Passed
Tokens
292
Input
24
Total output
0
Reasoning within output
merge_conflicts f007
100%
Passed
Tokens
297
Input
8
Total output
0
Reasoning within output
merge_conflicts f008
100%
Passed
Tokens
279
Input
6
Total output
0
Reasoning within output
merge_conflicts f009
100%
Passed
Tokens
276
Input
5
Total output
0
Reasoning within output
merge_conflicts f010
100%
Passed
Tokens
344
Input
24
Total output
0
Reasoning within output
merge_conflicts f011
100%
Passed
Tokens
315
Input
25
Total output
0
Reasoning within output
merge_conflicts f012
0%
Failed
Tokens
393
Input
44
Total output
0
Reasoning within output
rebase f001
0%
Failed
Tokens
267
Input
4
Total output
0
Reasoning within output
rebase f002
100%
Passed
Tokens
295
Input
7
Total output
0
Reasoning within output
rebase f003
100%
Passed
Tokens
272
Input
3
Total output
0
Reasoning within output
rebase f004
100%
Passed
Tokens
314
Input
21
Total output
0
Reasoning within output
rebase f005
100%
Passed
Tokens
311
Input
18
Total output
0
Reasoning within output
rebase f006
100%
Passed
Tokens
305
Input
24
Total output
0
Reasoning within output
rebase f007
100%
Passed
Tokens
296
Input
8
Total output
0
Reasoning within output
rebase f008
100%
Passed
Tokens
289
Input
6
Total output
0
Reasoning within output
rebase f009
100%
Passed
Tokens
273
Input
5
Total output
0
Reasoning within output
rebase f010
100%
Passed
Tokens
369
Input
24
Total output
0
Reasoning within output
rebase f011
100%
Passed
Tokens
325
Input
21
Total output
0
Reasoning within output
rebase f012
0%
Failed
Tokens
424
Input
37
Total output
0
Reasoning within output
reflog f001
100%
Passed
Tokens
373
Input
20
Total output
0
Reasoning within output
reflog f002
100%
Passed
Tokens
373
Input
93
Total output
0
Reasoning within output
reflog f003
100%
Passed
Tokens
351
Input
36
Total output
0
Reasoning within output
reflog f004
100%
Passed
Tokens
450
Input
150
Total output
0
Reasoning within output
reflog f005
100%
Passed
Tokens
487
Input
118
Total output
0
Reasoning within output
reflog f006
100%
Passed
Tokens
376
Input
83
Total output
0
Reasoning within output
reflog f007
100%
Passed
Tokens
407
Input
94
Total output
0
Reasoning within output
reflog f008
100%
Passed
Tokens
477
Input
95
Total output
0
Reasoning within output
reflog f009
100%
Passed
Tokens
450
Input
66
Total output
0
Reasoning within output
reflog f010
100%
Passed
Tokens
404
Input
129
Total output
0
Reasoning within output
reflog f011
100%
Passed
Tokens
451
Input
158
Total output
0
Reasoning within output
reflog f012
100%
Passed
Tokens
446
Input
72
Total output
0
Reasoning within output
stash_recovery f001
100%
Passed
Tokens
294
Input
37
Total output
0
Reasoning within output
stash_recovery f002
100%
Passed
Tokens
428
Input
4
Total output
0
Reasoning within output
stash_recovery f003
100%
Passed
Tokens
283
Input
4
Total output
0
Reasoning within output
stash_recovery f004
100%
Passed
Tokens
283
Input
13
Total output
0
Reasoning within output
stash_recovery f005
100%
Passed
Tokens
291
Input
62
Total output
0
Reasoning within output
stash_recovery f006
100%
Passed
Tokens
338
Input
6
Total output
0
Reasoning within output
stash_recovery f007
100%
Passed
Tokens
360
Input
9
Total output
0
Reasoning within output
stash_recovery f008
100%
Passed
Tokens
333
Input
23
Total output
0
Reasoning within output
stash_recovery f009
100%
Passed
Tokens
362
Input
4
Total output
0
Reasoning within output
stash_recovery f010
100%
Passed
Tokens
290
Input
5
Total output
0
Reasoning within output
stash_recovery f011
100%
Passed
Tokens
282
Input
47
Total output
0
Reasoning within output
stash_recovery f012
100%
Passed
Tokens
293
Input
6
Total output
0
Reasoning within output
submodule_usage f001
100%
Passed
Tokens
218
Input
8
Total output
0
Reasoning within output
submodule_usage f002
100%
Passed
Tokens
262
Input
11
Total output
0
Reasoning within output
submodule_usage f003
75%
Failed
Tokens
270
Input
29
Total output
0
Reasoning within output
submodule_usage f004
100%
Passed
Tokens
259
Input
3
Total output
0
Reasoning within output
submodule_usage f005
100%
Passed
Tokens
225
Input
26
Total output
0
Reasoning within output
submodule_usage f006
100%
Passed
Tokens
256
Input
3
Total output
0
Reasoning within output
submodule_usage f007
100%
Passed
Tokens
225
Input
17
Total output
0
Reasoning within output
submodule_usage f008
100%
Passed
Tokens
261
Input
5
Total output
0
Reasoning within output
submodule_usage f009
100%
Passed
Tokens
260
Input
17
Total output
0
Reasoning within output
submodule_usage f010
100%
Passed
Tokens
263
Input
8
Total output
0
Reasoning within output
submodule_usage f011
100%
Passed
Tokens
265
Input
4
Total output
0
Reasoning within output
submodule_usage f012
100%
Passed
Tokens
223
Input
11
Total output
0
Reasoning within output
tag_management f001
100%
Passed
Tokens
234
Input
6
Total output
0
Reasoning within output
tag_management f002
100%
Passed
Tokens
229
Input
20
Total output
0
Reasoning within output
tag_management f003
100%
Passed
Tokens
236
Input
9
Total output
0
Reasoning within output
tag_management f004
100%
Passed
Tokens
240
Input
2
Total output
0
Reasoning within output
tag_management f005
100%
Passed
Tokens
254
Input
7
Total output
0
Reasoning within output
tag_management f006
100%
Passed
Tokens
237
Input
18
Total output
0
Reasoning within output
tag_management f007
100%
Passed
Tokens
237
Input
34
Total output
0
Reasoning within output
tag_management f008
100%
Passed
Tokens
239
Input
20
Total output
0
Reasoning within output
tag_management f009
100%
Passed
Tokens
243
Input
19
Total output
0
Reasoning within output
tag_management f010
100%
Passed
Tokens
223
Input
7
Total output
0
Reasoning within output
tag_management f011
100%
Passed
Tokens
220
Input
5
Total output
0
Reasoning within output
tag_management f012
50%
Failed
Tokens
257
Input
22
Total output
0
Reasoning within output
worktree_usage f001
100%
Passed
Tokens
294
Input
9
Total output
0
Reasoning within output
worktree_usage f002
100%
Passed
Tokens
306
Input
19
Total output
0
Reasoning within output
worktree_usage f003
100%
Passed
Tokens
348
Input
8
Total output
0
Reasoning within output
worktree_usage f004
100%
Passed
Tokens
345
Input
4
Total output
0
Reasoning within output
worktree_usage f005
100%
Passed
Tokens
287
Input
11
Total output
0
Reasoning within output
worktree_usage f006
100%
Passed
Tokens
290
Input
14
Total output
0
Reasoning within output
worktree_usage f007
100%
Passed
Tokens
286
Input
19
Total output
0
Reasoning within output
worktree_usage f008
100%
Passed
Tokens
313
Input
49
Total output
0
Reasoning within output
worktree_usage f009
100%
Passed
Tokens
373
Input
4
Total output
0
Reasoning within output
worktree_usage f010
100%
Passed
Tokens
353
Input
15
Total output
0
Reasoning within output
worktree_usage f011
100%
Passed
Tokens
346
Input
8
Total output
0
Reasoning within output
worktree_usage f012
100%
Passed
Tokens
284
Input
13
Total output
0
Reasoning within output