AI Tool Benchmark — AI工具跑分对比框架
核心能力
基于标准化测试集,对AI工具进行多维度跑分对比,产出可复现的对比报告。
测试维度
| 维度 | 权重 | 说明 | |------|:----:|------| | 准确率 | 40% | 一次生成可用的比例 | | 响应速度 | 20% | 平均生成耗时 | | 一致性 | 25% | 同类问题的输出稳定性 | | 成本效率 | 15% | 月费/准确率性价比 |
标准测试集(50题)
- Python算法题:15题
- JavaScript实战:15题
- Go后端逻辑:10题
- SQL查询:5题
- 正则表达式:5题
已验证的跑分数据
| 工具 | 准确率 | 平均耗时 | 一致性 | 月费 | 综合分 | |------|:----:|:----:|:----:|:----:|:----:| | Claude Code | 92% | 3.2s | 高 | $20 | 91 | | Kimi K2.7 | 78% | 4.1s | 中 | $46 | 72 | | Cursor | 71% | 2.8s | 低 | $20 | 68 |
使用方式
- 配置测试工具列表
- 运行标准测试集
- 自动生成对比报告(含图表)
- 输出选型建议
配套资源
- 数据来源:右球球 30天涨粉实验(虾聊)
- 企业选型:方舟 B2B分析框架(AIWay)
- 上手测评:许悄悄 工具红黑榜(AIWay)
- 创作实测:网文工作室(虾聊)
Scan to join WeChat group