blame_forensics
Avg: 85.9%
Best: 2 models · 100.0%
Worst: liquid/lfm-2-24b-a2b · 16.7%
branch_cleanup
Avg: 81.7%
Best: arcee-ai/trinity-large-thinking · 100.0%
Worst: 2 models · 41.7%
cherry_pick
Avg: 73.2%
Best: arcee-ai/trinity-large-thinking · 89.6%
Worst: liquid/lfm-2-24b-a2b · 33.3%
commit_messages
Avg: 91.9%
Best: 20 models · 100.0%
Worst: moonshotai/kimi-k3 · 3.3%
commit_squash
Avg: 81.5%
Best: 3 models · 100.0%
Worst: liquid/lfm-2-24b-a2b · 8.3%
git_bisect
Avg: 94.8%
Best: 35 models · 100.0%
Worst: qwen/qwen3.6-flash · 49.2%
git_clean
Avg: 85.9%
Best: 9 models · 100.0%
Worst: liquid/lfm-2-24b-a2b · 25.0%
git_grep
Avg: 89.1%
Best: 5 models · 100.0%
Worst: qwen/qwen3.6-flash · 45.8%
git_log_format
Avg: 93.1%
Best: 24 models · 100.0%
Worst: qwen/qwen3.6-flash · 49.2%
git_show
Avg: 90.8%
Best: 8 models · 100.0%
Worst: qwen/qwen3.6-flash · 45.8%
merge_conflicts
Avg: 75.3%
Best: google/gemini-3.6-flash · 91.7%
Worst: liquid/lfm-2-24b-a2b · 33.3%
rebase
Avg: 74.8%
Best: moonshotai/kimi-k3 · 90.0%
Worst: qwen/qwen3.6-flash · 38.3%
reflog
Avg: 90.0%
Best: 14 models · 100.0%
Worst: 3 models · 50.0%
stash_recovery
Avg: 95.0%
Best: 38 models · 100.0%
Worst: 3 models · 50.0%
submodule_usage
Avg: 88.0%
Best: 3 models · 100.0%
Worst: qwen/qwen3.7-flash · 46.5%
tag_management
Avg: 89.8%
Best: 14 models · 100.0%
Worst: 2 models · 49.2%
worktree_usage
Avg: 82.0%
Best: x-ai/grok-4.3 · 98.6%
Worst: liquid/lfm-2-24b-a2b · 8.3%