GitBench by GitKraken
Overview Models Benchmarks Explore Compare Methodology

Benchmarks

blame_forensics Avg: 85.9%
Best: 2 models · 100.0% Worst: liquid/lfm-2-24b-a2b · 16.7%
branch_cleanup Avg: 81.7%
Best: arcee-ai/trinity-large-thinking · 100.0% Worst: 2 models · 41.7%
cherry_pick Avg: 73.2%
Best: arcee-ai/trinity-large-thinking · 89.6% Worst: liquid/lfm-2-24b-a2b · 33.3%
commit_messages Avg: 91.9%
Best: 20 models · 100.0% Worst: moonshotai/kimi-k3 · 3.3%
commit_squash Avg: 81.5%
Best: 3 models · 100.0% Worst: liquid/lfm-2-24b-a2b · 8.3%
git_bisect Avg: 94.8%
Best: 35 models · 100.0% Worst: qwen/qwen3.6-flash · 49.2%
git_clean Avg: 85.9%
Best: 9 models · 100.0% Worst: liquid/lfm-2-24b-a2b · 25.0%
git_grep Avg: 89.1%
Best: 5 models · 100.0% Worst: qwen/qwen3.6-flash · 45.8%
git_log_format Avg: 93.1%
Best: 24 models · 100.0% Worst: qwen/qwen3.6-flash · 49.2%
git_show Avg: 90.8%
Best: 8 models · 100.0% Worst: qwen/qwen3.6-flash · 45.8%
merge_conflicts Avg: 75.3%
Best: google/gemini-3.6-flash · 91.7% Worst: liquid/lfm-2-24b-a2b · 33.3%
rebase Avg: 74.8%
Best: moonshotai/kimi-k3 · 90.0% Worst: qwen/qwen3.6-flash · 38.3%
reflog Avg: 90.0%
Best: 14 models · 100.0% Worst: 3 models · 50.0%
stash_recovery Avg: 95.0%
Best: 38 models · 100.0% Worst: 3 models · 50.0%
submodule_usage Avg: 88.0%
Best: 3 models · 100.0% Worst: qwen/qwen3.7-flash · 46.5%
tag_management Avg: 89.8%
Best: 14 models · 100.0% Worst: 2 models · 49.2%
worktree_usage Avg: 82.0%
Best: x-ai/grok-4.3 · 98.6% Worst: liquid/lfm-2-24b-a2b · 8.3%
GitBench - Automated Git Task Benchmark 2026-08-09