TapTap Maker Benchmark
TapTap Maker / 编程 · 在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。
在 AIGZL 中仅供参考
证据预算不参与排序
上游数据时间10/09 08:00
最近成功同步10/10 20:31
它测什么,怎么测
只取官方 main_board 的 L2 通过率;成本、速度、Held-out 和分类分不再次投票。同一基础模型按固定推理档位优先级选代表行,选择不看分数。
如何使用这份证据
仅供参考:现有结果混合不同 agent driver,不能作为相同执行流程下的底层型号比较。
评测成绩
按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 85.8% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 2 | claude-fable-5-1Anthropic | 85.5% | High 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 3 | claude-opus-5-5Anthropic | 85.5% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 4 | gpt-6.1-solOpenAI | 85.3% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 5 | claude-sonnet-5-5Anthropic | 83.6% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 6 | muse-spark-1.3-contributorMeta | 81.3% | xHigh 推理未计入:来源的 contributor 别名未对应到已核实的公开模型。 |
| 7 | gemini-3.8-flashGoogle | 79.8% | High 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 8 | gpt-5.6-solOpenAI | 79.8% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 9 | grok-4.7-xhighxAI | 77.8% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 10 | gpt-6-solOpenAI | 76.8% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 11 | gpt-6-lunaOpenAI | 76.6% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 12 | qwen3.8-max-0902Alibaba | 76.2% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 13 | glm-5.3Z.ai | 76.2% | Max 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 14 | deepseek-v4.1-flashDeepSeek | 76.1% | Max 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 15 | qwen3.8-flashAlibaba | 76.0% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 16 | claude-haiku-5-5Anthropic | 75.8% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 17 | glm-5.3-flashZ.ai | 75.0% | Max 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 18 | gpt-5.6-terraOpenAI | 74.2% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 19 | hy4-previewTencent | 72.5% | High 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 20 | kimi-k3Moonshot AI | 72.3% | 来源默认配置未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 21 | gpt-5.6-lunaOpenAI | 72.2% | xHigh 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 22 | doubao-seed-evolvingByteDance | 71.6% | High 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 23 | deepseek-v4-proDeepSeek | 70.5% | Max 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 25 | deepseek-v4-flashDeepSeek | 69.1% | Max 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 26 | gemini-3.1-pro-previewGoogle | 59.5% | 来源默认配置未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 27 | MiniMax-M3MiniMax | 54.1% | 来源默认配置未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
| 28 | claude-haiku-4-5Anthropic | 38.5% | High 推理未计入:不同模型使用不同 Agent 驱动,不能作为统一条件下的单模型成绩。 |
评测局限与数据署名
单引擎、单语言,不能推广到其他技术栈;不同模型可能使用不同 agent 驱动;闭源 harness 不能逐题复算。 当前采用的执行驱动不同,不计入单型号排序。
数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以易玩/TapTap 条款为准
成绩由 TapTap Maker 发布,各项原始分数使用不同尺度,不能直接相加;参考位次采用公开的分差标准化规则。