Z-ai / glm-4.7-flash
none
78.9%
161 / 204 fixtures · 1 run(s)
35,311 input / 3,729 total output / 0 reasoning within output tokens $0.00351868
Reliability by Benchmark (Text)
Loading reliability summary…
Text vs JSON Schema Comparison
Pass Rate Delta
+2%
Text: 78.9% →
JSON: 80.9%
+13
Gained
JSON pass / text fail
−9
Lost
Text pass / JSON fail
152
Unchanged Pass
Both pass
30
Unchanged Fail
Both fail
Fixture Reliability Delta
| Fixture | Text | JSON | Delta |
|---|
Benchmark Deltas
| Benchmark | Text | JSON | Delta |
|---|---|---|---|
| worktree_usage | 66.7% | 91.7% | + 25% |
| blame_forensics | 91.7% | 75% | -16.7% |
| git_bisect | 75% | 91.7% | + 16.7% |
| merge_conflicts | 50% | 66.7% | + 16.7% |
| reflog | 100% | 83.3% | -16.7% |
| git_clean | 83.3% | 91.7% | + 8.3% |
| git_log_format | 83.3% | 91.7% | + 8.3% |
| tag_management | 91.7% | 83.3% | -8.3% |
| git_grep | 75% | 83.3% | + 8.3% |
| branch_cleanup | 25% | 16.7% | -8.3% |
| cherry_pick | 75% | 75% | + 0% |
| commit_messages | 100% | 100% | + 0% |
| commit_squash | 83.3% | 83.3% | + 0% |
| git_show | 91.7% | 91.7% | + 0% |
| rebase | 75% | 75% | + 0% |
| stash_recovery | 100% | 100% | + 0% |
| submodule_usage | 75% | 75% | + 0% |
Changed Fixtures (22)
Fixture Gallery (204)
blame_forensics f001
100%
Passed
Tokens
221
Input
6
Total output
0
Reasoning within output
blame_forensics f002
100%
Passed
Tokens
207
Input
4
Total output
0
Reasoning within output
blame_forensics f003
100%
Passed
Tokens
236
Input
6
Total output
0
Reasoning within output
blame_forensics f004
100%
Passed
Tokens
173
Input
6
Total output
0
Reasoning within output
blame_forensics f005
0%
Failed
Tokens
230
Input
6
Total output
0
Reasoning within output
blame_forensics f006
100%
Passed
Tokens
209
Input
3
Total output
0
Reasoning within output
blame_forensics f007
100%
Passed
Tokens
189
Input
6
Total output
0
Reasoning within output
blame_forensics f008
100%
Passed
Tokens
216
Input
5
Total output
0
Reasoning within output
blame_forensics f009
100%
Passed
Tokens
171
Input
5
Total output
0
Reasoning within output
blame_forensics f010
100%
Passed
Tokens
369
Input
4
Total output
0
Reasoning within output
blame_forensics f011
100%
Passed
Tokens
208
Input
4
Total output
0
Reasoning within output
blame_forensics f012
100%
Passed
Tokens
129
Input
6
Total output
0
Reasoning within output
branch_cleanup f001
0%
Failed
Tokens
99
Input
2
Total output
0
Reasoning within output
branch_cleanup f002
100%
Passed
Tokens
114
Input
5
Total output
0
Reasoning within output
branch_cleanup f003
0%
Failed
Tokens
93
Input
5
Total output
0
Reasoning within output
branch_cleanup f004
0%
Failed
Tokens
128
Input
6
Total output
0
Reasoning within output
branch_cleanup f005
0%
Failed
Tokens
105
Input
3
Total output
0
Reasoning within output
branch_cleanup f006
0%
Failed
Tokens
117
Input
4
Total output
0
Reasoning within output
branch_cleanup f007
100%
Passed
Tokens
99
Input
6
Total output
0
Reasoning within output
branch_cleanup f008
33.3%
Failed
Tokens
119
Input
4
Total output
0
Reasoning within output
branch_cleanup f009
0%
Failed
Tokens
81
Input
3
Total output
0
Reasoning within output
branch_cleanup f010
0%
Failed
Tokens
114
Input
6
Total output
0
Reasoning within output
branch_cleanup f011
0%
Failed
Tokens
68
Input
1
Total output
0
Reasoning within output
branch_cleanup f012
100%
Passed
Tokens
147
Input
11
Total output
0
Reasoning within output
cherry_pick f001
0%
Failed
Tokens
89
Input
8
Total output
0
Reasoning within output
cherry_pick f002
100%
Passed
Tokens
111
Input
7
Total output
0
Reasoning within output
cherry_pick f003
100%
Passed
Tokens
84
Input
4
Total output
0
Reasoning within output
cherry_pick f004
100%
Passed
Tokens
144
Input
23
Total output
0
Reasoning within output
cherry_pick f005
100%
Passed
Tokens
143
Input
21
Total output
0
Reasoning within output
cherry_pick f006
100%
Passed
Tokens
132
Input
21
Total output
0
Reasoning within output
cherry_pick f007
100%
Passed
Tokens
124
Input
10
Total output
0
Reasoning within output
cherry_pick f008
100%
Passed
Tokens
117
Input
7
Total output
0
Reasoning within output
cherry_pick f009
100%
Passed
Tokens
102
Input
5
Total output
0
Reasoning within output
cherry_pick f010
50%
Failed
Tokens
201
Input
25
Total output
0
Reasoning within output
cherry_pick f011
100%
Passed
Tokens
155
Input
25
Total output
0
Reasoning within output
cherry_pick f012
0%
Failed
Tokens
256
Input
39
Total output
0
Reasoning within output
commit_messages f001
93.3%
Passed
Tokens
101
Input
4
Total output
0
Reasoning within output
commit_messages f002
82.7%
Passed
Tokens
197
Input
3
Total output
0
Reasoning within output
commit_messages f003
95.3%
Passed
Tokens
79
Input
7
Total output
0
Reasoning within output
commit_messages f004
93.3%
Passed
Tokens
107
Input
4
Total output
0
Reasoning within output
commit_messages f005
90%
Passed
Tokens
96
Input
3
Total output
0
Reasoning within output
commit_messages f006
51.7%
Passed
Tokens
131
Input
2
Total output
0
Reasoning within output
commit_messages f007
90%
Passed
Tokens
173
Input
4
Total output
0
Reasoning within output
commit_messages f008
91.7%
Passed
Tokens
69
Input
5
Total output
0
Reasoning within output
commit_messages f009
81.7%
Passed
Tokens
120
Input
6
Total output
0
Reasoning within output
commit_messages f010
89.3%
Passed
Tokens
259
Input
6
Total output
0
Reasoning within output
commit_messages f011
71%
Passed
Tokens
137
Input
7
Total output
0
Reasoning within output
commit_messages f012
91.7%
Passed
Tokens
120
Input
4
Total output
0
Reasoning within output
commit_squash f001
100%
Passed
Tokens
137
Input
13
Total output
0
Reasoning within output
commit_squash f002
100%
Passed
Tokens
115
Input
9
Total output
0
Reasoning within output
commit_squash f003
100%
Passed
Tokens
122
Input
13
Total output
0
Reasoning within output
commit_squash f004
100%
Passed
Tokens
113
Input
12
Total output
0
Reasoning within output
commit_squash f005
100%
Passed
Tokens
108
Input
7
Total output
0
Reasoning within output
commit_squash f006
0%
Failed
Tokens
97
Input
21
Total output
0
Reasoning within output
commit_squash f007
100%
Passed
Tokens
99
Input
12
Total output
0
Reasoning within output
commit_squash f008
100%
Passed
Tokens
110
Input
13
Total output
0
Reasoning within output
commit_squash f009
100%
Failed
Tokens
104
Input
15
Total output
0
Reasoning within output
commit_squash f010
100%
Passed
Tokens
118
Input
15
Total output
0
Reasoning within output
commit_squash f011
100%
Passed
Tokens
125
Input
16
Total output
0
Reasoning within output
commit_squash f012
100%
Passed
Tokens
122
Input
21
Total output
0
Reasoning within output
git_bisect f001
100%
Passed
Tokens
167
Input
5
Total output
0
Reasoning within output
git_bisect f002
100%
Passed
Tokens
192
Input
6
Total output
0
Reasoning within output
git_bisect f003
100%
Passed
Tokens
194
Input
6
Total output
0
Reasoning within output
git_bisect f004
0%
Failed
Tokens
194
Input
4
Total output
0
Reasoning within output
git_bisect f005
100%
Passed
Tokens
190
Input
7
Total output
0
Reasoning within output
git_bisect f006
100%
Passed
Tokens
217
Input
7
Total output
0
Reasoning within output
git_bisect f007
100%
Passed
Tokens
196
Input
7
Total output
0
Reasoning within output
git_bisect f008
0%
Failed
Tokens
196
Input
8
Total output
0
Reasoning within output
git_bisect f009
100%
Passed
Tokens
190
Input
5
Total output
0
Reasoning within output
git_bisect f010
0%
Failed
Tokens
190
Input
4
Total output
0
Reasoning within output
git_bisect f011
100%
Passed
Tokens
194
Input
5
Total output
0
Reasoning within output
git_bisect f012
100%
Passed
Tokens
219
Input
5
Total output
0
Reasoning within output
git_clean f001
100%
Passed
Tokens
46
Input
8
Total output
0
Reasoning within output
git_clean f002
100%
Passed
Tokens
57
Input
5
Total output
0
Reasoning within output
git_clean f003
100%
Passed
Tokens
54
Input
5
Total output
0
Reasoning within output
git_clean f004
100%
Passed
Tokens
54
Input
6
Total output
0
Reasoning within output
git_clean f005
100%
Passed
Tokens
46
Input
5
Total output
0
Reasoning within output
git_clean f006
100%
Passed
Tokens
69
Input
9
Total output
0
Reasoning within output
git_clean f007
50%
Failed
Tokens
63
Input
9
Total output
0
Reasoning within output
git_clean f008
100%
Passed
Tokens
74
Input
5
Total output
0
Reasoning within output
git_clean f009
100%
Passed
Tokens
62
Input
7
Total output
0
Reasoning within output
git_clean f010
100%
Passed
Tokens
58
Input
6
Total output
0
Reasoning within output
git_clean f011
100%
Passed
Tokens
58
Input
11
Total output
0
Reasoning within output
git_clean f012
50%
Failed
Tokens
60
Input
15
Total output
0
Reasoning within output
git_grep f001
100%
Passed
Tokens
48
Input
3
Total output
0
Reasoning within output
git_grep f002
100%
Passed
Tokens
60
Input
2
Total output
0
Reasoning within output
git_grep f003
100%
Passed
Tokens
81
Input
2
Total output
0
Reasoning within output
git_grep f004
100%
Passed
Tokens
73
Input
5
Total output
0
Reasoning within output
git_grep f005
100%
Passed
Tokens
108
Input
1
Total output
0
Reasoning within output
git_grep f006
0%
Failed
Tokens
38
Input
1
Total output
0
Reasoning within output
git_grep f007
0%
Failed
Tokens
154
Input
2
Total output
0
Reasoning within output
git_grep f008
0%
Failed
Tokens
55
Input
2
Total output
0
Reasoning within output
git_grep f009
100%
Passed
Tokens
51
Input
4
Total output
0
Reasoning within output
git_grep f010
100%
Passed
Tokens
59
Input
2
Total output
0
Reasoning within output
git_grep f011
100%
Passed
Tokens
105
Input
2
Total output
0
Reasoning within output
git_grep f012
100%
Passed
Tokens
62
Input
9
Total output
0
Reasoning within output
git_log_format f001
100%
Passed
Tokens
764
Input
1
Total output
0
Reasoning within output
git_log_format f002
100%
Passed
Tokens
746
Input
7
Total output
0
Reasoning within output
git_log_format f003
100%
Passed
Tokens
602
Input
9
Total output
0
Reasoning within output
git_log_format f004
100%
Passed
Tokens
747
Input
1
Total output
0
Reasoning within output
git_log_format f005
100%
Failed
Tokens
600
Input
8
Total output
0
Reasoning within output
git_log_format f006
0%
Failed
Tokens
729
Input
1
Total output
0
Reasoning within output
git_log_format f007
100%
Passed
Tokens
750
Input
5
Total output
0
Reasoning within output
git_log_format f008
100%
Passed
Tokens
984
Input
2
Total output
0
Reasoning within output
git_log_format f009
100%
Passed
Tokens
596
Input
1
Total output
0
Reasoning within output
git_log_format f010
100%
Passed
Tokens
1,121
Input
2
Total output
0
Reasoning within output
git_log_format f011
100%
Passed
Tokens
368
Input
3
Total output
0
Reasoning within output
git_log_format f012
100%
Passed
Tokens
334
Input
1
Total output
0
Reasoning within output
git_show f001
100%
Passed
Tokens
172
Input
3
Total output
0
Reasoning within output
git_show f002
0%
Failed
Tokens
172
Input
2
Total output
0
Reasoning within output
git_show f003
100%
Passed
Tokens
576
Input
6
Total output
0
Reasoning within output
git_show f004
100%
Passed
Tokens
396
Input
7
Total output
0
Reasoning within output
git_show f005
100%
Passed
Tokens
177
Input
2
Total output
0
Reasoning within output
git_show f006
100%
Passed
Tokens
180
Input
1
Total output
0
Reasoning within output
git_show f007
100%
Passed
Tokens
168
Input
4
Total output
0
Reasoning within output
git_show f008
100%
Passed
Tokens
182
Input
28
Total output
0
Reasoning within output
git_show f009
100%
Passed
Tokens
274
Input
2
Total output
0
Reasoning within output
git_show f010
100%
Passed
Tokens
171
Input
2
Total output
0
Reasoning within output
git_show f011
100%
Passed
Tokens
198
Input
3
Total output
0
Reasoning within output
git_show f012
100%
Passed
Tokens
292
Input
2
Total output
0
Reasoning within output
merge_conflicts f001
0%
Failed
Tokens
79
Input
4
Total output
0
Reasoning within output
merge_conflicts f002
0%
Failed
Tokens
99
Input
7
Total output
0
Reasoning within output
merge_conflicts f003
100%
Passed
Tokens
74
Input
5
Total output
0
Reasoning within output
merge_conflicts f004
100%
Passed
Tokens
131
Input
24
Total output
0
Reasoning within output
merge_conflicts f005
100%
Passed
Tokens
130
Input
17
Total output
0
Reasoning within output
merge_conflicts f006
0%
Failed
Tokens
119
Input
21
Total output
0
Reasoning within output
merge_conflicts f007
100%
Passed
Tokens
124
Input
10
Total output
0
Reasoning within output
merge_conflicts f008
100%
Passed
Tokens
101
Input
7
Total output
0
Reasoning within output
merge_conflicts f009
0%
Failed
Tokens
98
Input
5
Total output
0
Reasoning within output
merge_conflicts f010
100%
Passed
Tokens
166
Input
25
Total output
0
Reasoning within output
merge_conflicts f011
0%
Failed
Tokens
136
Input
20
Total output
0
Reasoning within output
merge_conflicts f012
0%
Failed
Tokens
219
Input
38
Total output
0
Reasoning within output
rebase f001
0%
Failed
Tokens
89
Input
4
Total output
0
Reasoning within output
rebase f002
100%
Passed
Tokens
118
Input
8
Total output
0
Reasoning within output
rebase f003
100%
Passed
Tokens
98
Input
3
Total output
0
Reasoning within output
rebase f004
100%
Passed
Tokens
145
Input
23
Total output
0
Reasoning within output
rebase f005
100%
Passed
Tokens
134
Input
14
Total output
0
Reasoning within output
rebase f006
0%
Failed
Tokens
132
Input
26
Total output
0
Reasoning within output
rebase f007
100%
Passed
Tokens
124
Input
9
Total output
0
Reasoning within output
rebase f008
100%
Passed
Tokens
115
Input
6
Total output
0
Reasoning within output
rebase f009
100%
Passed
Tokens
98
Input
5
Total output
0
Reasoning within output
rebase f010
100%
Passed
Tokens
191
Input
25
Total output
0
Reasoning within output
rebase f011
100%
Passed
Tokens
145
Input
26
Total output
0
Reasoning within output
rebase f012
0%
Failed
Tokens
250
Input
38
Total output
0
Reasoning within output
reflog f001
100%
Passed
Tokens
212
Input
26
Total output
0
Reasoning within output
reflog f002
100%
Passed
Tokens
210
Input
59
Total output
0
Reasoning within output
reflog f003
100%
Passed
Tokens
188
Input
93
Total output
0
Reasoning within output
reflog f004
100%
Passed
Tokens
307
Input
189
Total output
0
Reasoning within output
reflog f005
100%
Passed
Tokens
344
Input
165
Total output
0
Reasoning within output
reflog f006
100%
Passed
Tokens
226
Input
132
Total output
0
Reasoning within output
reflog f007
100%
Passed
Tokens
253
Input
173
Total output
0
Reasoning within output
reflog f008
100%
Passed
Tokens
319
Input
330
Total output
0
Reasoning within output
reflog f009
100%
Passed
Tokens
287
Input
195
Total output
0
Reasoning within output
reflog f010
100%
Passed
Tokens
245
Input
156
Total output
0
Reasoning within output
reflog f011
100%
Passed
Tokens
309
Input
128
Total output
0
Reasoning within output
reflog f012
100%
Passed
Tokens
309
Input
233
Total output
0
Reasoning within output
stash_recovery f001
100%
Passed
Tokens
127
Input
6
Total output
0
Reasoning within output
stash_recovery f002
100%
Passed
Tokens
277
Input
8
Total output
0
Reasoning within output
stash_recovery f003
100%
Passed
Tokens
114
Input
14
Total output
0
Reasoning within output
stash_recovery f004
100%
Passed
Tokens
110
Input
19
Total output
0
Reasoning within output
stash_recovery f005
100%
Passed
Tokens
119
Input
21
Total output
0
Reasoning within output
stash_recovery f006
100%
Passed
Tokens
167
Input
12
Total output
0
Reasoning within output
stash_recovery f007
100%
Passed
Tokens
195
Input
17
Total output
0
Reasoning within output
stash_recovery f008
100%
Passed
Tokens
162
Input
16
Total output
0
Reasoning within output
stash_recovery f009
100%
Passed
Tokens
194
Input
18
Total output
0
Reasoning within output
stash_recovery f010
100%
Passed
Tokens
117
Input
13
Total output
0
Reasoning within output
stash_recovery f011
100%
Passed
Tokens
111
Input
13
Total output
0
Reasoning within output
stash_recovery f012
100%
Passed
Tokens
124
Input
14
Total output
0
Reasoning within output
submodule_usage f001
100%
Passed
Tokens
40
Input
8
Total output
0
Reasoning within output
submodule_usage f002
0%
Failed
Tokens
91
Input
22
Total output
0
Reasoning within output
submodule_usage f003
50%
Failed
Tokens
96
Input
31
Total output
0
Reasoning within output
submodule_usage f004
100%
Passed
Tokens
80
Input
4
Total output
0
Reasoning within output
submodule_usage f005
100%
Passed
Tokens
47
Input
27
Total output
0
Reasoning within output
submodule_usage f006
0%
Failed
Tokens
78
Input
12
Total output
0
Reasoning within output
submodule_usage f007
100%
Passed
Tokens
47
Input
17
Total output
0
Reasoning within output
submodule_usage f008
100%
Passed
Tokens
90
Input
8
Total output
0
Reasoning within output
submodule_usage f009
100%
Passed
Tokens
78
Input
6
Total output
0
Reasoning within output
submodule_usage f010
100%
Passed
Tokens
88
Input
6
Total output
0
Reasoning within output
submodule_usage f011
100%
Passed
Tokens
93
Input
4
Total output
0
Reasoning within output
submodule_usage f012
100%
Passed
Tokens
45
Input
11
Total output
0
Reasoning within output
tag_management f001
100%
Passed
Tokens
55
Input
7
Total output
0
Reasoning within output
tag_management f002
100%
Passed
Tokens
52
Input
19
Total output
0
Reasoning within output
tag_management f003
100%
Passed
Tokens
57
Input
9
Total output
0
Reasoning within output
tag_management f004
100%
Passed
Tokens
66
Input
4
Total output
0
Reasoning within output
tag_management f005
100%
Passed
Tokens
75
Input
12
Total output
0
Reasoning within output
tag_management f006
50%
Failed
Tokens
58
Input
19
Total output
0
Reasoning within output
tag_management f007
100%
Passed
Tokens
61
Input
32
Total output
0
Reasoning within output
tag_management f008
100%
Passed
Tokens
64
Input
22
Total output
0
Reasoning within output
tag_management f009
100%
Passed
Tokens
67
Input
16
Total output
0
Reasoning within output
tag_management f010
100%
Passed
Tokens
46
Input
7
Total output
0
Reasoning within output
tag_management f011
100%
Passed
Tokens
46
Input
5
Total output
0
Reasoning within output
tag_management f012
100%
Passed
Tokens
83
Input
8
Total output
0
Reasoning within output
worktree_usage f001
25%
Failed
Tokens
131
Input
11
Total output
0
Reasoning within output
worktree_usage f002
0%
Failed
Tokens
130
Input
14
Total output
0
Reasoning within output
worktree_usage f003
100%
Passed
Tokens
190
Input
9
Total output
0
Reasoning within output
worktree_usage f004
100%
Passed
Tokens
190
Input
4
Total output
0
Reasoning within output
worktree_usage f005
33.3%
Failed
Tokens
120
Input
9
Total output
0
Reasoning within output
worktree_usage f006
100%
Passed
Tokens
121
Input
13
Total output
0
Reasoning within output
worktree_usage f007
100%
Passed
Tokens
119
Input
20
Total output
0
Reasoning within output
worktree_usage f008
0%
Failed
Tokens
145
Input
39
Total output
0
Reasoning within output
worktree_usage f009
100%
Passed
Tokens
219
Input
5
Total output
0
Reasoning within output
worktree_usage f010
100%
Passed
Tokens
201
Input
16
Total output
0
Reasoning within output
worktree_usage f011
100%
Passed
Tokens
191
Input
8
Total output
0
Reasoning within output
worktree_usage f012
100%
Passed
Tokens
118
Input
13
Total output
0
Reasoning within output