Benchmark

與通用 Agent(Claude Code)比較:Precision / F1 更高,token 只要 1/9

一句話結論

與通用 agent(Claude Code)比較,Open Code Review 在相同底層模型下達到顯著更高的 PrecisionF1,而 token 消耗只有約 1/9、完成得更快。注意它的 Recall 較低——這是刻意取捨:優先精準、降低雜訊。

基準建構

指標

指標量什麼為什麼重要
F1Precision 與 Recall 的調和平均整體評審品質的最佳單一數字
Precision回報問題中「真實缺陷」的比例越高 = 越少的誤報要 triage
Recall真實缺陷中被找到的比例越高 = 越少問題漏過
Avg Time每次評審的牆鐘時間影響 CI 管線延遲
Avg Token每次評審消耗總 token直接影響 API 成本
為什麼省 token?確定性管線(精確檔案選擇、智慧 bundling、規則匹配、定位模組)讓 agent 只需要專注在「真正要動腦」的部分——不重複讀檔、不盲目探索,token 自然只有通用 agent 的 1/9。
Recall 的取捨:通用 agent 通常會掃更多、報更多(高 Recall),但誤報也多。OCR 刻意選擇「少而準」——多數工程團隊在 code review 上更痛的是雜訊而不是漏檢。
📖 教學解說:Benchmark 深入解讀

Precision vs Recall 的取捨邏輯

通用 agent(Claude Code)通常有較高的 Recall(找到更多問題),但 Precision 較低(誤報多)。OCR 刻意選擇「少而準」——多數工程團隊在 code review 上更痛的是雜訊而不是漏檢。誤報需要人工 triage,成本高;漏檢可以在後續 review 中補上。

為什麼省 9 倍 token

確定性管線讓 Agent 只需要專注在「真正要動腦」的部分:

  • 精確檔案選擇 → 不審不需要的檔
  • 智慧 bundling → 相關檔案併在一起審
  • 規則匹配 → 模型注意力精準聚焦
  • 定位模組 → 不浪費 token 在行號計算上

結果:同一個模型,token 消耗只有 1/9。

基準建構的可信度

50 個熱門開源 repo、200 個真實 PR、10 種語言、80+ 資深工程師交叉驗證、1,505 條標註 ground-truth。這不是玩具基準——這是生產級的評估。

🔍 Worked Example:解讀 Benchmark 結果

Step 1 — 比較 Precision

假設 OCR 回報 10 條評論,其中 8 條是真實缺陷 → Precision = 80%。通用 agent 回報 25 條,其中 12 條是真實缺陷 → Precision = 48%。

Step 2 — 比較 Recall

地面真相有 15 條缺陷。OCR 找到 8 條 → Recall = 53%。通用 agent 找到 12 條 → Recall = 80%。

Step 3 — 比較 F1

OCR: F1 = 2 × (0.8 × 0.53) / (0.8 + 0.53) = 64%。通用 agent: F1 = 2 × (0.48 × 0.8) / (0.48 + 0.8) = 60%。OCR 的 F1 更高,因為 Precision 的提升補償了 Recall 的下降。

Step 4 — 比較成本

OCR 平均消耗 3,200 token/PR。通用 agent 平均消耗 28,800 token/PR。OCR 只花 1/9 的成本。

練習 / 驗收清單

  • 能解釋 Precision vs Recall 的取捨邏輯
  • 能說明為什麼省 9 倍 token
  • 能描述基準建構的可信度

完整 benchmark 圖表與方法論見上游 README Benchmark 段