效能基準

WITH vs WITHOUT——「省成本」是真的,但「殘留上下文佔用更多」也是真的
7 個真實開源 repo · 7 種語言 · 中位數 4 runs/arm · 2026-08-05 重測(Claude Opus 4.8)

結論先講

通用勝利:每個 repo、每個規模——88% 更少工具呼叫 · 53% 更快 · 62% 更少 token · 44% 更便宜 · 檔案讀取七個 repo 全歸零

有索引時,agent 用 1–4 次 codegraph_explore 呼叫就答完並停止;沒有時,agent 把預算燒在 discovery——最多 43 次工具呼叫、19 次檔案讀取去重新推導圖譜早就知道的東西。每個 repo 都更快:最窄的問題快 35%,最寬的快 3.6×。

七個 repo 對照(中位數,WITH vs WITHOUT)

Codebase語言工具呼叫時間檔案讀取Token成本
VS CodeTypeScript · ~11k 檔2 vs 282.2× 快(58s vs 2m10s)0 vs 1277% 少71% 省
ExcalidrawTypeScript · ~6402 vs 433.6× 快(45s vs 2m42s)0 vs 1884% 少78% 省
DjangoPython · ~3k3 vs 1435% 快0 vs 8.541% 少13% 省¹
TokioRust · ~7903 vs 292.6× 快0 vs 1965% 少64% 省
OkHttpJava · ~6451 vs 643% 快0 vs 254% 少21% 省
GinGo · ~1101 vs 739% 快0 vs 452% 少~even¹
AlamofireSwift · ~1104 vs 332.6× 快0 vs 16.559% 少57% 省

¹ 成本跟「問題需要多少 discovery」有關,比其它欄波動大:需 28–43 次工具呼叫的 repo 省 57–78%,Django 14 次、Gin 7 次就答到的只省 13% 或打平。WITH arm 仍只用 3 / 1 次呼叫、零檔案讀取。

方法論(誠實的部分)

但代價也是真的:殘留上下文佔用

誠實取捨:以上數字量的是 throughput(處理的 token、呼叫的工具、花的錢)。若量「session 結束後 context window 裡還剩下什麼」,CodeGraph 反而更多——同樣七 repo 多輪 session,CodeGraph 的回應在結束時留下約 80% 更多的 retrieval context(VS Code 上 67k vs 18k token)。機制正是它快的原因:CodeGraph 回傳一坨 dense、逐字的 payload,答完問題後就留在 window 裡;grep-and-read agent 則 churn 很多會被逐出的小結果。處理較少 token 與較大常駐 footprint 同時為真。小窗口跑長 session 時要把這個算進預算。
看完這頁你應該能說出:七 repo 的通用勝利數字、為什麼「成本」欄比其他欄波動大、CLI 封鎖對對照可信度的重要性、以及殘留上下文佔用的誠實取捨。