← 返回目录
评测

minghinmatthewlam/openbench

同一模型不同外壳的编码 Agent harness 横向测评基准。

Same model, different wrapper: a from-scratch benchmark comparing coding-agent harnesses (codex, pi, opencode, cursor, devin) and open models on correctness, speed, and token cost
ai-agentsbenchmarkcoding-agentsevalsllmopen-models
语言Python
Star121
分类评测(eval)
状态活跃
收录时间2026-08-05
来源deepseek-harness-x