blame_forensics
Avg: 85.5%
Best: 2 models · 100.0%
Worst: liquid/lfm-2-24b-a2b · 16.7%
branch_cleanup
Avg: 81.9%
Best: arcee-ai/trinity-large-thinking · 100.0%
Worst: 2 models · 41.7%
cherry_pick
Avg: 73.0%
Best: arcee-ai/trinity-large-thinking · 89.6%
Worst: liquid/lfm-2-24b-a2b · 33.3%
commit_messages
Avg: 91.5%
Best: 17 models · 100.0%
Worst: moonshotai/kimi-k3 · 3.3%
commit_squash
Avg: 81.1%
Best: 3 models · 100.0%
Worst: liquid/lfm-2-24b-a2b · 8.3%
git_bisect
Avg: 94.5%
Best: 32 models · 100.0%
Worst: qwen/qwen3.6-flash · 49.2%
git_clean
Avg: 85.3%
Best: 7 models · 100.0%
Worst: liquid/lfm-2-24b-a2b · 25.0%
git_grep
Avg: 88.9%
Best: 5 models · 100.0%
Worst: qwen/qwen3.6-flash · 45.8%
git_log_format
Avg: 92.9%
Best: 22 models · 100.0%
Worst: qwen/qwen3.6-flash · 49.2%
git_show
Avg: 90.4%
Best: 8 models · 100.0%
Worst: qwen/qwen3.6-flash · 45.8%
merge_conflicts
Avg: 75.1%
Best: google/gemini-3.6-flash · 91.7%
Worst: liquid/lfm-2-24b-a2b · 33.3%
rebase
Avg: 74.5%
Best: moonshotai/kimi-k3 · 90.0%
Worst: qwen/qwen3.6-flash · 38.3%
reflog
Avg: 89.9%
Best: 14 models · 100.0%
Worst: 3 models · 50.0%
stash_recovery
Avg: 94.8%
Best: 36 models · 100.0%
Worst: 3 models · 50.0%
submodule_usage
Avg: 87.9%
Best: 3 models · 100.0%
Worst: qwen/qwen3.7-flash · 46.5%
tag_management
Avg: 89.3%
Best: 12 models · 100.0%
Worst: 2 models · 49.2%
worktree_usage
Avg: 81.7%
Best: x-ai/grok-4.3 · 98.6%
Worst: liquid/lfm-2-24b-a2b · 8.3%