GitBench by GitKraken
Overview Models Benchmarks Explore Compare Methodology

Benchmarks

blame_forensics Avg: 85.5%
Best: 2 models · 100.0% Worst: liquid/lfm-2-24b-a2b · 16.7%
branch_cleanup Avg: 81.9%
Best: arcee-ai/trinity-large-thinking · 100.0% Worst: 2 models · 41.7%
cherry_pick Avg: 73.0%
Best: arcee-ai/trinity-large-thinking · 89.6% Worst: liquid/lfm-2-24b-a2b · 33.3%
commit_messages Avg: 91.5%
Best: 17 models · 100.0% Worst: moonshotai/kimi-k3 · 3.3%
commit_squash Avg: 81.1%
Best: 3 models · 100.0% Worst: liquid/lfm-2-24b-a2b · 8.3%
git_bisect Avg: 94.5%
Best: 32 models · 100.0% Worst: qwen/qwen3.6-flash · 49.2%
git_clean Avg: 85.3%
Best: 7 models · 100.0% Worst: liquid/lfm-2-24b-a2b · 25.0%
git_grep Avg: 88.9%
Best: 5 models · 100.0% Worst: qwen/qwen3.6-flash · 45.8%
git_log_format Avg: 92.9%
Best: 22 models · 100.0% Worst: qwen/qwen3.6-flash · 49.2%
git_show Avg: 90.4%
Best: 8 models · 100.0% Worst: qwen/qwen3.6-flash · 45.8%
merge_conflicts Avg: 75.1%
Best: google/gemini-3.6-flash · 91.7% Worst: liquid/lfm-2-24b-a2b · 33.3%
rebase Avg: 74.5%
Best: moonshotai/kimi-k3 · 90.0% Worst: qwen/qwen3.6-flash · 38.3%
reflog Avg: 89.9%
Best: 14 models · 100.0% Worst: 3 models · 50.0%
stash_recovery Avg: 94.8%
Best: 36 models · 100.0% Worst: 3 models · 50.0%
submodule_usage Avg: 87.9%
Best: 3 models · 100.0% Worst: qwen/qwen3.7-flash · 46.5%
tag_management Avg: 89.3%
Best: 12 models · 100.0% Worst: 2 models · 49.2%
worktree_usage Avg: 81.7%
Best: x-ai/grok-4.3 · 98.6% Worst: liquid/lfm-2-24b-a2b · 8.3%
GitBench - Automated Git Task Benchmark 2026-08-05