與通用 agent(Claude Code)比較,Open Code Review 在相同底層模型下達到顯著更高的 Precision 與 F1,而 token 消耗只有約 1/9、完成得更快。注意它的 Recall 較低——這是刻意取捨:優先精準、降低雜訊。
| 指標 | 量什麼 | 為什麼重要 |
|---|---|---|
| F1 | Precision 與 Recall 的調和平均 | 整體評審品質的最佳單一數字 |
| Precision | 回報問題中「真實缺陷」的比例 | 越高 = 越少的誤報要 triage |
| Recall | 真實缺陷中被找到的比例 | 越高 = 越少問題漏過 |
| Avg Time | 每次評審的牆鐘時間 | 影響 CI 管線延遲 |
| Avg Token | 每次評審消耗總 token | 直接影響 API 成本 |
通用 agent(Claude Code)通常有較高的 Recall(找到更多問題),但 Precision 較低(誤報多)。OCR 刻意選擇「少而準」——多數工程團隊在 code review 上更痛的是雜訊而不是漏檢。誤報需要人工 triage,成本高;漏檢可以在後續 review 中補上。
確定性管線讓 Agent 只需要專注在「真正要動腦」的部分:
結果:同一個模型,token 消耗只有 1/9。
50 個熱門開源 repo、200 個真實 PR、10 種語言、80+ 資深工程師交叉驗證、1,505 條標註 ground-truth。這不是玩具基準——這是生產級的評估。
假設 OCR 回報 10 條評論,其中 8 條是真實缺陷 → Precision = 80%。通用 agent 回報 25 條,其中 12 條是真實缺陷 → Precision = 48%。
地面真相有 15 條缺陷。OCR 找到 8 條 → Recall = 53%。通用 agent 找到 12 條 → Recall = 80%。
OCR: F1 = 2 × (0.8 × 0.53) / (0.8 + 0.53) = 64%。通用 agent: F1 = 2 × (0.48 × 0.8) / (0.48 + 0.8) = 60%。OCR 的 F1 更高,因為 Precision 的提升補償了 Recall 的下降。
OCR 平均消耗 3,200 token/PR。通用 agent 平均消耗 28,800 token/PR。OCR 只花 1/9 的成本。
完整 benchmark 圖表與方法論見上游 README Benchmark 段。