BrickBench: 评 测 智能 体 式 积木 设计
BrickBench 评测编程智能体能否按文本设计可搭建的乐高套装。有了验证环境,有效性几乎被解决,但设计质量仍明显不及人类。

本文目录
Peter Kulits,Yiqing Xu,R. Kenny Jones,Cordelia Schmid,Jiajun Wu
斯坦福大学;马克斯·普朗克智能系统研究所;Inria
Model:一只鹈鹕骑着自行车。
Set:一只棕色的狗,长着下垂的黑耳朵,戴着一顶小小的棕色帽子,坐在着火房间里的一张桌子旁。一只白色咖啡杯放在它面前。火焰爬上窗帘,围住椅子,但这只狗坐得笔直,爪子平静地搁在桌面上。房间正面敞开,以便露出这一场景。
Alt-Build:一个戴宽边帽的牛仔骑在一匹配了鞍的马上,旁边是一株举起两臂的仙人掌。他把套好的套索举过头顶。马的前腿站在一块低矮的岩石上,后腿仍留在沙地上。
GPT-6 Astra,Claude Opus 5.5,Qwen 3.8 Flash,Gemini 3.8 Flash,Muse Spark 1.3
图 1:我们评测编程智能体根据文本提示设计乐高拼搭的能力。我们引入三种约束不同的设定:Model($\leq$ 400 个零件)、Set(400–4000 个零件)和 Alt-Build(套装 10698 的零件清单)。上面的每一件拼搭都可以被搭建出来。
BrickBench:评测智能体式积木设计
摘要
我们提出 BrickBench,一个面向智能体式、以文本为条件的乐高套装设计的基准。给定一条提示,智能体的任务是产出一件拼搭:它不仅要满足语义和设计标准,还必须能够被实际搭建。为此,它必须从一个离散零件库中选择零件,并同时推理局部约束和全局约束。我们在三种规模和零件可得性各不相同的设定中,给有效性、对齐和设计打分。我们提供 BrickAgent,一个供编程智能体构造、检查并验证其设计的环境。我们发现,领先的智能体大体上满足可验证的物理要求和语义要求,但仍不及人类设计。我们在 http://www.brickben.ch 发布该基准和环境。
1 引言
设计一件乐高拼搭,难处比看上去更大。设计者必须从成千上万个零件中挑选,把它们排成可辨认的形态,并确保结构能够立住。面向积木拼搭的计算生成方法,一直依赖专门模型和精心设计的表示来处理这些挑战(Chung et al., 2021; Pun et al., 2025; Kulits & Schmid, 2026)。编程智能体提供的是另一条路:它们可以写程序、执行程序、检查结果并修改。这一转变已经在改变软件工程(Jimenez et al., 2024)、图形学(Gu et al., 2025)和 CAD(Zhang et al., 2026)。我们发现,一个没有经过任务特定训练的通用编程智能体,在 BrickNet 基准(Kulits & Schmid, 2026)上大幅超过专门的乐高生成模型,并接近其参照拼搭的语义对齐(图 2)。
然而,这是否意味着智能体已经学会设计乐高?已有评测留下两个尚未探索的重要挑战。第一是物理复杂度:BrickNet 评测的是至多 100 个零件的小物体,远不是一整套乐高里成百上千个相互连接的零件和库存约束。第二,也更根本的,是设计质量:做出一件能用的拼搭,并不等于做出一件值得搭建的拼搭。乐高的吸引力不只在于复现一个物体,而在于构造的创造性:巧妙的零件用法、形状、比例和细节。两件拼搭可以同样有效、同样忠实于一段描述,但在设计得好不好上相差极大。与物理有效性或同提示的语义对齐不同,设计质量没有确定的通过/失败检验。
我们引入 BrickBench,一个面向智能体式、以文本为条件的乐高套装设计的基准(图 1)。BrickBench 包含三种设定下的 300 条提示:Model(至多 400 个零件)、Set(400–4000 个零件)和 Alt-Build(一份固定的零件库存)。为支持复杂构造,我们引入 BrickAgent,一个面向智能体式乐高设计的环境,包含构造工具,以及对连接、碰撞和稳定性的可解释验证。BrickAgent 并不规定如何设计一件拼搭,而是提供积木、约束和反馈,把解法留给智能体自己去想。为了评测有效性和语义对齐所遗漏的东西,我们通过成对判断来度量设计质量,并用人类偏好加以验证。
我们评测十一个前沿智能体和两个数据驱动的基线。有了 BrickAgent,领先智能体几乎对每一条提示都产出有效拼搭,最好的一个满足大约 95% 的语义要求。去掉该环境会急剧降低物理有效性,说明可靠的构造依赖于有根据的工具和反馈。然而设计质量把智能体分得远得多,人类评分者在 360 次比较中的 323 次里认出了人类设计的拼搭。这些发现揭示乐高设计的挑战已经转移:智能体正在学会搭建能用的东西,但还不会做出出色的设计。
我们的贡献如下。
- 1. BrickBench,一个包含三种设定、300 条提示的智能体式积木设计基准,指标包括物理有效性(连接、碰撞,以及仿真下的稳定性)、语义对齐(VQA,针对从每条提示分解出的是/否问题),以及设计质量(ELO,来自一个经过人类评分者验证的视觉语言模型所做的成对判断)。
- 2. BrickAgent,一个使编程智能体能够以程序方式构造、检查并验证复杂乐高拼搭的环境,带有零件搜索、按连接器放置、子装配、渲染,以及点名出错零件的验证器。没有它,有效拼搭的比例对 GPT-6 Astra 从 100% 降到 40%,对 GPT-5.6 Luna 降到 1% 以下。
- 3. 对十一个前沿智能体和两个数据驱动基线的系统评测,以及验证设计指标并度量与人类设计差距的人类研究。
2 相关工作
智能体基准。 编程智能体的基准通过执行来验证智能体的工作。SWE-bench(Jimenez et al., 2024)在智能体提交的补丁上运行仓库的测试,OSWorld(Xie et al., 2024)通过执行追踪状态。SceneCraft(Hu et al., 2024)编写 Blender 脚本,CAD-Assistant(Mallis et al., 2025)编写 CAD 程序。基准随后执行该程序并给结果打分。BlenderGym(Gu et al., 2025)把结果与目标场景比较,BenchCAD(Zhang et al., 2026)执行面向工业零件的 CadQuery 程序。BuildArena(Xia et al., 2026)按仿真行为给由模块化零件装配成的机器打分,PhyBlock(Ma et al., 2025)在物理仿真器中给积木放置的合理性打分。BrickBench 把智能体的程序执行为真实乐高零件的拼搭,并在仿真下验证连接、碰撞和稳定性。
乐高与评测。 先前工作用学习得到的模型生成乐高拼搭,并用乐高任务评测其他系统。BrickGPT(Pun et al., 2025)微调一个语言模型,根据一段说明把八种积木类型放在 $20{\times}20{\times}20$ 的网格上。BrickNet(Kulits & Schmid, 2026)预测的是连接而不是位置,并通过带类型的连接器自回归地生成结构。LEGO-Maker(Ge et al., 2025)以图像为条件生成建筑立面。另一些工作在乐高任务上评测智能体和多模态模型。Break and Make(Walsman et al., 2022)在仿真器中给智能体一个 LDraw 模型,检验它能否检查、拆开并从零重建。LEGO-Puzzles(Tang et al., 2026)向多模态模型提出关于装配步骤的空间问题。BrickBench 两件事都做:通用编程智能体根据文本提示生成套装规模的拼搭,而我们从物理有效性、提示对齐和设计上给这些拼搭打分。
3 预备知识
3.1 LDraw
LDraw 是一个由社区维护的零件库和数字乐高建模标准。1 https://www.ldraw.org 。库中每个零件都意在对应一个真实世界的对应件。拼搭被表示为文本文件,其中的实例由其零件类型、颜色和六维位姿定义。然而 LDraw 本身并不判定一件拼搭是否能连在一起,或者能否被搭建。
3.2 连接性与物理有效性
BrickNet(Kulits & Schmid, 2026)为 LDraw 库中的每个零件标注带类型的连接器。每个连接器实例有类型、子类型、极性和一个坐标系。子类型在其类型之内命名连接器的几何,并固定它与什么相配:凸点与孔或管相配,杆与夹相配。极性区分铰链、球或固定关节的两半,它们必须相反才能连接。坐标系是连接器在其零件坐标中的位置和朝向,其中一条轴沿配合方向。当两个零件实例的一对相容连接器在容差内对齐时,它们相连。
连接器有五种类型。凸点连接器允许绕连接轴旋转,铰链允许旋转以及可能的翻转,轴还额外允许沿其轴线滑动。球允许自由旋转,固定类型的连接器不允许运动。
一件拼搭中实例之间的连接构成零件上的一张图。一件拼搭可以有不止一个连通分量,以表示包含多个(不相连)物体的场景。若一件拼搭在重力下保持静止,我们定义它是稳定的。我们把连通分量当作拼搭的刚体,并在 PyBullet(Coumans & Bai, 2016–2021)中把它们仿真为密度均匀的单个刚体。我们设置高摩擦系数和零恢复系数,使分量之间的接触既不滑动也不反弹。一个分量在没有支撑时会因坠落而失败。若任何分量上没有任何一点移动超过一块积木凸点高度的四分之三,即 3 个 LDraw 单位(LDU),我们就认为该拼搭稳定。凸点连接的夹持力和轴的间隙等效应没有被建模,因此一件作为刚体能平衡的拼搭会通过,即便搭出来的实物可能会下垂或散开。评估这一点需要结构仿真,要么在每个连接处设力的上限,要么对零件做有限元模型,我们在第 6 节讨论。当两个零件的几何重叠超过容差时,它们发生碰撞。有碰撞的拼搭不能被搭建,并在仿真之前就被判定为无效。
3.3 以文本为条件的拼搭
这是一个小型、块状的乐高机器人模型,主要由黄色和黑色积木构成,带有关节肢体、轮状的手和脚,并从多个角度呈现以展示其设计。
这是一个经典乐高人仔的三维模型,黄色的头和手,红色棒球帽,素白躯干,蓝色的腿,在白色背景上从多个角度展示。
GT,GPT-5.6 Luna,BrickNet-14B,BrickGPT
(a)
| 方法 | PE $\uparrow$ | SigLIP 2 $\uparrow$ | VQAScore $\uparrow$ |
|---|---|---|---|
| BrickGPT | 0.157 | 0.052 | 0.050 |
| BrickNet-0.6B | 0.279 | 0.603 | 0.557 |
| BrickNet-1.7B | 0.282 | 0.631 | 0.593 |
| BrickNet-4B | 0.283 | 0.639 | 0.615 |
| BrickNet-8B | 0.284 | 0.647 | 0.608 |
| BrickNet-14B | 0.283 | 0.625 | 0.602 |
| GT | 0.315 | 0.826 | 0.748 |
| GPT-5.6 Luna | 0.313 | 0.818 | 0.732 |
(b)
图 2:BrickNet 验证。我们在 BrickNet 的文本到拼搭验证集上评测 GPT-5.6 Luna(Kulits & Schmid, 2026)。尽管它并未针对该数据集专门化,我们发现它在各项指标上超过包括 BrickGPT(Pun et al., 2025)在内的任务特定基线,并接近真实物体的对齐。(a)输入样本与模型输出。(b)遵循 BrickNet 评测协议的说明对齐。PE(Bolya et al., 2025)和 SigLIP 2(Tschannen et al., 2025)给渲染图嵌入与说明嵌入之间的相似度打分,VQAScore(Lin et al., 2024)则是一个 VQA 模型在被问及渲染图是否展示该说明时回答“是”的概率。指标计算的细节见 Kulits & Schmid (2026)。
在以文本为条件的拼搭中,系统收到一条文本提示,任务是产出一件描绘它的拼搭。系统必须从库中选择零件类型,并为每个实例指定颜色、位置和三维旋转。
先前工作 BrickNet 在从网上收集的人类设计拼搭上,为这一任务训练语言模型。它的说明由视觉–语言模型根据已有拼搭的渲染图生成。验证集包含 512 条这样的留出说明,来自至多 100 个零件的单个物体。
我们在 BrickNet 验证提示上评测通用编程智能体 GPT-5.6 Luna(图 2)。智能体获得第 4.3 节所述的环境。为与 BrickNet 匹配,我们把智能体限制在 100 个零件。输出按其渲染图与提示之间的对齐来打分,用 PE(Bolya et al., 2025)、SigLIP 2(Tschannen et al., 2025)和 VQAScore(Lin et al., 2024)度量。
尽管没有在该数据集上训练,这个智能体大幅超过任务特定基线 BrickNet 和 BrickGPT(Pun et al., 2025),在每一项指标上与留出的(GT)拼搭相差都在 0.02 以内,实际上使这一评测饱和。这促使我们设计一个新基准。
4 BrickBench
BrickBench 是一个智能体式、以文本为条件的乐高套装设计基准。给定一条文本提示,智能体必须产出一件满足语义和设计标准、并且能够被实际搭建的拼搭。该基准由三种设定中的 300 条提示(第 4.1 节)、一个编程智能体可以在其中搭建的环境,以及针对有效性、语义对齐和设计质量的评测协议(第 4.4 节)组成。除第 5.2 节的消融和两个数据驱动基线之外,智能体都在第 4.3 节所述的 BrickAgent 环境中工作。
4.1 设定
这些设定的差别在于智能体用来搭建的零件。在 Model 设定中,智能体至多可以使用 400 个零件,而 Set 设定要求使用 400–4000 个零件。二者都从 BrickNet 所支持的完整 LDraw 库中取用,共 14,441 种零件类型。在 Alt-Build 设定中,智能体只能使用零售套装 10698 的 783 块零件、104 种零件类型。2 https://www.bricklink.com/v2/catalog/catalogitem.page?S=10698 。其中大多是基本积木和板,另有少量窗、门、轮子和装饰元件。违反这些限制的拼搭通不过有效性检查。
这些设定意在评测不同能力。Model 作为基础评测,检验主要由单个连通分量构成的拼搭的创作。Set 的规模被选来对应 BrickLink Designer Program 的要求,3 https://www.bricklink.com/v3/designer-program/main.page ,检验智能体能否搭建出完整零售套装规模的拼搭。Alt-Build 评测智能体在稀缺、固定的零件库存下做设计的能力。
4.2 提示
每种评测设定有 100 条提示,十个主题类别各十条。它们遵循 BrickLink Designer Program,只是我们把 Floral / Nature / Animal 类别拆成 Floral / Nature 和 Animal。类别为:Medieval / Castle、Vehicle / Boat / Airplane、Train、Space / Sci-Fi / Fantasy、Art / Object、Building、Floral / Nature、Animal、Pirate,以及 History / Period。按设定划分的提示样本见图 1 和图 4。提示通过提示一个 LLM 构造,并经过人工验证是否符合要求。提示平均长度在 Alt-Build 中为 31 个词,Model 中为 45 个词,Set 中为 57 个词。
我们把每条生成提示分解成 DSG(Cho et al., 2024)风格的问题图。DSG 评测文本到图像的生成:用一个 LLM 把提示变成原子的是/否问题,按图依赖组织之后,再用一个视觉语言模型回答。问题覆盖提示所点名的实体、它们的属性,以及它们之间的关系。有了这张图,我们可以避免评测被其他失败所废掉的性质,例如在尚未确立骑士存在时去检查骑士盔甲的颜色。按类型的分布见图 A1,完整的示例图见图 A2,二者都在附录 A。
4.3 BrickAgent
我们引入 BrickAgent,智能体在其中搭建的环境。它包含 LDraw 库、BrickNet 连接器系统,以及以程序方式编写、验证和查看一件拼搭的工具。这些工具包括在库中搜索零件、按位置或按连接器放置零件、镜像和测量、定义子装配并组合它们,以及从任意视点渲染拼搭的函数。所提供的验证器包含第 3.2 节的连接、碰撞和稳定性测试,并以可解释的方式报告每一次失败及所涉及的零件。这使智能体能够在提交之前验证拼搭的物理要求。
提示用做过的例子解释该环境,并陈述该设定的零件要求。它告知智能体,有经验的乐高设计师会按已出版套装的标准,把这件拼搭与其他拼搭相比较来评判。在第 5.2 节的消融中,智能体在同一容器中运行,带有控制 CLI、LDraw 库和任务要求,但没有 BrickAgent 的工具。我们发现,没有这些工具,前沿编程智能体不能可靠地构造有效拼搭。
4.4 指标
我们按设定给每个系统打分,并额外在全部三种设定上汇总(Overall)。若一件拼搭满足其设定的零件要求,并且在第 3.2 节的测试下既无碰撞又稳定,则判定为有效。Valid 是一个比例,并在每一条提示上打分。
VQA 度量与提示之间有界的语义对齐,遵循 DSG。我们用 BrickNet 的渲染器从八个视图渲染该拼搭,渲染设置保持一致。然后我们用一次调用,让 Gemma 4 31B(Gemma Team, 2026)回答图中的每一个问题,并指示它根据视图所示来判断,回答是或否。一件拼搭的分数是其问题被满足的比例,VQA 是各拼搭上的均值。
ELO 度量相对于其他系统的相对语义对齐和设计质量。对每条提示,我们组成来自不同系统的拼搭的每一种配对,并向评判者展示每一件的四个视图。我们对每一对问两个问题:1)对齐问题把提示给评判者,并问哪一件拼搭与它更匹配。2)设计问题不给提示,并问按官方套装的标准哪一件设计得更好,评判的是零件如何被使用,而不是题材。每一对都以两种顺序提问,以消除位置偏差。附录 B 的图 A3 包含评判提示。我们对每个问题的胜场拟合 Bradley–Terry 模型(Bradley & Terry, 1952),并把它们报告为 ELO。我们锚定到第 5 节所注明的一组固定参照。ELO 是 Align ELO 与 Design ELO 在相对于锚点重新缩放到共同散布之后的平均。
VQA 和 ELO 在系统所生成的拼搭上打分,不考虑它们是否 Valid。Cost 是一个系统为产出一件拼搭所消耗词元的标价,以美元计。对两个经过训练的基线,它是每件拼搭的服务成本:BrickNet 按基础模型的无服务器词元费率,BrickGPT 按租用 GPU 实例上的挂钟时间。
5 评测
表 1:BrickBench。我们报告三种评测设定各自的指标,以及汇总(Overall)。Valid 要求拼搭满足该设定的零件要求,并且既无碰撞又稳定。VQA 是被满足的 VQA 问题所占比例(第 4.4 节)。ELO、Align ELO 和 Design ELO 是从成对视觉语言模型判断估计出的评分(第 4.4 节)。Cost 是产出一件拼搭的 API 成本(美元),或 BrickGPT(Pun et al., 2025)的等价成本。BrickNet-14B(Kulits & Schmid, 2026)的 Valid 指标不包含稳定性,因为该模型并不在规范坐标系中产出拼搭,重力方向没有定义。*
| 系统 | Valid $\uparrow$ | VQA $\uparrow$ | ELO $\uparrow$ | Align ELO $\uparrow$ | Design ELO $\uparrow$ | Cost(美元)$\downarrow$ |
|---|---|---|---|---|---|---|
| Overall | ||||||
| GPT-6 Astra | 1.00 | 0.954 | 1297 $\pm$ 22 | 1295 $\pm$ 27 | 1299 $\pm$ 27 | 4.06 |
| GPT-6.1 Sol | 1.00 | 0.945 | 1293 $\pm$ 23 | 1301 $\pm$ 27 | 1286 $\pm$ 26 | 0.87 |
| Claude Opus 5.5 | 0.99 | 0.923 | 1249 $\pm$ 23 | 1212 $\pm$ 26 | 1287 $\pm$ 27 | 6.33 |
| Claude Opus 5 | 1.00 | 0.908 | 1101 $\pm$ 17 | 1095 $\pm$ 20 | 1108 $\pm$ 20 | 16.47 |
| Qwen 3.8 Flash | 0.90 | 0.852 | 1048 $\pm$ 17 | 1040 $\pm$ 21 | 1057 $\pm$ 20 | 1.75 |
| GPT-5.6 Sol | 1.00 | 0.859 | 1015 $\pm$ 16 | 1041 $\pm$ 19 | 988 $\pm$ 19 | 1.02 |
| Gemini 3.8 Flash | 0.98 | 0.856 | 1014 $\pm$ 17 | 1005 $\pm$ 21 | 1024 $\pm$ 20 | 3.70 |
| DeepSeek V4.1 Flash | 0.94 | 0.813 | 1006 $\pm$ 17 | 998 $\pm$ 20 | 1015 $\pm$ 20 | 0.71 |
| GPT-5.6 Luna | 1.00 | 0.792 | 898 $\pm$ 16 | 917 $\pm$ 19 | 879 $\pm$ 20 | 0.75 |
| Muse Spark 1.3 | 0.80 | 0.718 | 868 $\pm$ 20 | 859 $\pm$ 24 | 878 $\pm$ 23 | 6.68 |
| GLM 5.3 Flash | 0.92 | 0.590 | 752 $\pm$ 23 | 750 $\pm$ 25 | 753 $\pm$ 29 | 0.54 |
| Model | ||||||
| GPT-6 Astra | 1.00 | 0.966 | 1266 $\pm$ 38 | 1277 $\pm$ 45 | 1254 $\pm$ 45 | 4.08 |
| GPT-6.1 Sol | 1.00 | 0.969 | 1269 $\pm$ 36 | 1272 $\pm$ 45 | 1265 $\pm$ 42 | 0.92 |
| Claude Opus 5.5 | 1.00 | 0.952 | 1236 $\pm$ 40 | 1216 $\pm$ 46 | 1252 $\pm$ 42 | 5.90 |
| Claude Opus 5 | 1.00 | 0.917 | 1083 $\pm$ 30 | 1075 $\pm$ 36 | 1089 $\pm$ 31 | 16.72 |
| Qwen 3.8 Flash | 0.95 | 0.921 | 1012 $\pm$ 27 | 1030 $\pm$ 30 | 996 $\pm$ 32 | 1.59 |
| GPT-5.6 Sol | 1.00 | 0.908 | 1032 $\pm$ 28 | 1051 $\pm$ 34 | 1015 $\pm$ 31 | 1.14 |
| Gemini 3.8 Flash | 0.98 | 0.894 | 1012 $\pm$ 34 | 995 $\pm$ 40 | 1028 $\pm$ 37 | 4.05 |
| DeepSeek V4.1 Flash | 0.95 | 0.857 | 1007 $\pm$ 30 | 1013 $\pm$ 33 | 1001 $\pm$ 33 | 0.65 |
| GPT-5.6 Luna | 1.00 | 0.821 | 892 $\pm$ 30 | 897 $\pm$ 34 | 889 $\pm$ 37 | 0.99 |
| Muse Spark 1.3 | 0.86 | 0.811 | 848 $\pm$ 31 | 845 $\pm$ 38 | 851 $\pm$ 36 | 5.99 |
| GLM 5.3 Flash | 0.90 | 0.658 | 848 $\pm$ 37 | 816 $\pm$ 42 | 878 $\pm$ 43 | 0.69 |
| BrickNet-14B | 0.26 | 0.180 | 731 $\pm$ 53 | 485 $\pm$ 62 | 952 $\pm$ 50 | 0.0006 |
| BrickGPT | 1.00 | 0.024 | 338 $\pm$ 45 | 129 $\pm$ 64 | 528 $\pm$ 60 | 0.04 |
| Set | ||||||
| GPT-6 Astra | 1.00 | 0.933 | 1305 $\pm$ 35 | 1291 $\pm$ 42 | 1316 $\pm$ 46 | 5.15 |
| GPT-6.1 Sol | 1.00 | 0.920 | 1295 $\pm$ 41 | 1293 $\pm$ 47 | 1292 $\pm$ 45 | 1.05 |
| Claude Opus 5.5 | 0.99 | 0.892 | 1240 $\pm$ 44 | 1174 $\pm$ 45 | 1315 $\pm$ 53 | 8.08 |
| Claude Opus 5 | 1.00 | 0.890 | 1100 $\pm$ 27 | 1092 $\pm$ 31 | 1109 $\pm$ 34 | 18.80 |
| Qwen 3.8 Flash | 0.79 | 0.801 | 1090 $\pm$ 38 | 1054 $\pm$ 44 | 1131 $\pm$ 41 | 2.26 |
| GPT-5.6 Sol | 1.00 | 0.832 | 993 $\pm$ 27 | 1019 $\pm$ 32 | 963 $\pm$ 32 | 1.16 |
| Gemini 3.8 Flash | 0.97 | 0.806 | 1012 $\pm$ 31 | 1010 $\pm$ 36 | 1013 $\pm$ 36 | 4.26 |
| DeepSeek V4.1 Flash | 0.87 | 0.786 | 1005 $\pm$ 35 | 979 $\pm$ 39 | 1036 $\pm$ 41 | 0.87 |
| GPT-5.6 Luna | 1.00 | 0.758 | 929 $\pm$ 26 | 952 $\pm$ 31 | 902 $\pm$ 35 | 0.85 |
| Muse Spark 1.3 | 0.68 | 0.661 | 871 $\pm$ 38 | 864 $\pm$ 46 | 882 $\pm$ 42 | 8.54 |
| GLM 5.3 Flash | 0.89 | 0.523 | 695 $\pm$ 33 | 738 $\pm$ 41 | 649 $\pm$ 45 | 0.61 |
| Alt-Build | ||||||
| GPT-6 Astra | 1.00 | 0.961 | 1325 $\pm$ 37 | 1314 $\pm$ 51 | 1336 $\pm$ 44 | 2.95 |
| GPT-6.1 Sol | 1.00 | 0.946 | 1326 $\pm$ 35 | 1339 $\pm$ 43 | 1312 $\pm$ 46 | 0.64 |
| Claude Opus 5.5 | 0.99 | 0.925 | 1277 $\pm$ 37 | 1248 $\pm$ 41 | 1307 $\pm$ 45 | 5.01 |
| Claude Opus 5 | 1.00 | 0.917 | 1126 $\pm$ 31 | 1120 $\pm$ 36 | 1132 $\pm$ 36 | 13.90 |
| Qwen 3.8 Flash | 0.97 | 0.827 | 1051 $\pm$ 27 | 1038 $\pm$ 35 | 1064 $\pm$ 36 | 1.39 |
| GPT-5.6 Sol | 1.00 | 0.836 | 1021 $\pm$ 31 | 1054 $\pm$ 36 | 986 $\pm$ 33 | 0.76 |
| Gemini 3.8 Flash | 1.00 | 0.867 | 1023 $\pm$ 25 | 1010 $\pm$ 31 | 1036 $\pm$ 31 | 2.79 |
| DeepSeek V4.1 Flash | 0.99 | 0.797 | 1007 $\pm$ 29 | 1002 $\pm$ 33 | 1014 $\pm$ 34 | 0.60 |
| GPT-5.6 Luna | 1.00 | 0.797 | 875 $\pm$ 28 | 903 $\pm$ 39 | 845 $\pm$ 37 | 0.40 |
| Muse Spark 1.3 | 0.86 | 0.678 | 887 $\pm$ 30 | 871 $\pm$ 36 | 904 $\pm$ 37 | 5.52 |
| GLM 5.3 Flash | 0.97 | 0.591 | 686 $\pm$ 36 | 688 $\pm$ 47 | 684 $\pm$ 47 | 0.31 |
图 3:BrickBench 摘要。我们报告在三种评测设定上平均的摘要指标。分解结果见表 1。ELO 图中的线表示 95% 区间。
我们评测十一个智能体和两个数据驱动基线。智能体包括 GPT-6 Astra、GPT-6.1 Sol、GPT-5.6 Sol、GPT-5.6 Luna、Claude Opus 5.5、Claude Opus 5、Gemini 3.8 Flash、Qwen 3.8 Flash、DeepSeek V4.1 Flash、GLM 5.3 Flash 和 Muse Spark 1.3。Opus 5 和 Opus 5.5 在 Claude Code 中运行,其余在 Codex CLI 中使用各厂商各自的 API。Astra、两个 Opus 模型和两个 Sol 模型以高推理力度评测以限制成本,Luna 以最大力度运行,其余以 xhigh 运行。每个智能体每条提示有 300 回合的预算。所评测的基线是 BrickNet-14B(Kulits & Schmid, 2026)和 BrickGPT(Pun et al., 2025),二者都限制在唯一适用的 Model 设定。九个智能体构成 ELO 标尺的参照集(第 4.4 节)。基线和第 5.2 节的消融运行对照它们来评分,并不影响标尺。Opus 5.5 和 GPT-6.1 Sol 是在第 5.3 节和第 5.4 节的人类研究跑完之后发布的,因此它们只在自动指标上被打分。与基线一样,它们对照参照集来评分,这使其他所有评分保持不变,并且二者都落在评判者已被验证的评分范围之内。
5.1 结果
Model 一辆绿色垃圾箱停在四个小黑轮上,高高一簇红、橙、黄的火焰把它的盖子顶开。一张揉皱的白纸从一角伸出,旁边倒着一只垃圾桶。
Model 一间逼仄的邮件室角落里,墙上贴满白色通知、信封和照片,红色的线把它们缠在一起。一个棕色头发、眼神狂乱的男人,穿着白衬衫、松开条纹领带,朝这块板比划。纸箱和溢出来的成堆邮件挤在它下面的地板上。
Model 一只蓝色海豚跃出明亮的青绿色海面,浅色的腹部背对彩虹。一道明亮的彩虹在它背后的柔软白云之间拱起。海豚的尾巴弯回一小团白色水花,而柔和的蓝色波浪填满彩虹下方的空间。
Set 一个全身黑衣、戴面具的剑客,与一个谢顶的小个子男人相对而坐,桌子是粗糙的石头,地点在岩石山坡上。两只银杯立在他们之间。谢顶男人背后,一个蒙眼的金发女人穿着红裙子,双手被绑着坐着。剑客一只戴手套的手搁在自己的杯子附近。
Set 一辆巨大的蓝色玩具机车,圆圆的灰色脸上带着微笑,从一栋两层郊区住宅的侧面冲出来。机车几乎和房子一样高,红色的缓冲梁伸到前草坪上方。碎掉的墙板落在它下面。两个人站在一辆停着的小汽车旁,抬头看这台引擎。
Set 一个金发女人穿着黑色露肩上衣,俯身越过餐厅桌子,大声喊叫,并直接指向对面坐着的一只白猫。一个深色头发的女人站在她身后,抓住她的肩膀,试图把她拉回来。猫笔直坐在餐椅上,耳朵张开,嘴微微张开,回头看那个指着它的女人。一盘绿色沙拉就放在猫面前。杯子、餐具和折好的餐巾铺在桌上,软垫椅子和一道低矮的餐厅隔断围住这场对峙。
Set 一个巨大的、大致呈球形的球,表面覆盖着朝各个方向伸出的家用物品:一把椅子、一台电视、一把伞、一只煎锅、一根香蕉,以及几本书。一个小小的绿色人偶,头是长圆柱,推着它的底座。球的前方,一只交通锥和一把茶壶还留在地板上。
Alt-Build 一条绿色海蛇从水中升起,旁边是一艘小海盗船。它的脖子弯过船头,尾巴则从船尾后面的水里露出来。
Alt-Build 一个小小的蓝甲骑士躲在盾牌后面,把长矛指向一只有他两倍高的蜗牛。蜗牛有一个大螺旋壳和两根竖起的眼柄。他们隔着一小块草地面对面。
Alt-Build 一辆蒸汽机车驶过河上的一座桥。桥在引擎正下方有一道单拱。
GPT-6 Astra,GPT-6.1 Sol,Claude Opus 5.5,Claude Opus 5,Qwen 3.8 Flash,GPT-5.6 Sol,Gemini 3.8 Flash,DeepSeek V4.1 Flash,GPT-5.6 Luna,Muse Spark 1.3,GLM 5.3 Flash
图 4:BrickBench 样本。我们对每种设定中的三条提示,展示十一个智能体各自的一件拼搭。我们观察到,智能体对提示的理解各不相同。Muse 缺一件拼搭,因为它没有在回合预算内交付。
(a)ELO 与成本
(b)对 Design ELO 的验证
图 5:ELO。(a)我们把 ELO 对平均拼搭成本作图。(b)为验证基于模型的 Design ELO 计算,我们做一项感知研究:参与者的任务是,对给定提示的一对拼搭判断设计质量。提示不给评判者,他们只根据图像做决定。我们发现排序在 36 对智能体中的 34 对上一致(Kendall $\tau=0.89$),说明该指标是人类判断的有效代理。这项研究覆盖九个参照智能体;Opus 5.5 和 GPT-6.1 Sol 是在它之后评测的。
我们在表 1 中按设定和汇总报告每一项指标,并把汇总列画在图 3 中。我们观察到,在提供该环境时,有效性几乎被解决。五个智能体对每一条提示都交付一件有效拼搭,总体上没有一个的 Valid 比例低于 0.80。参照集里的 137 件无效拼搭中,44 件是没有交付拼搭的提示。其余失败于稳定性(41)、碰撞(31)和零件要求(21)。
VQA 把参照集温和地分开,从 GLM 的 0.59 到 Astra 的 0.95。Design ELO 分得更陡,GLM 与 Astra 之间相差 545 个 ELO 点,这个差距可以解释为评判者在大约 96% 的配对中偏好 Astra 的拼搭。在参照集内部,Astra 在每一项指标上领先,Opus 5 排第二,但成本是它的四倍。Sol、Gemini、Qwen 和 DeepSeek 构成中间一组,彼此相差不超过 41 个 ELO 点。两个后来的智能体中,GPT-6.1 Sol 在 ELO 上与 Astra 相当(1293 对 1297,区间重叠),成本是它的五分之一;Opus 5.5 比 Opus 5 高 148 点,成本是它的 40%,在 Design ELO 上落在 Astra 的区间内,但 Align ELO 低 83 点。对齐随问题种类的变化大于随题材的变化(附录 C 的图 A7)。没有哪一个提示类别始终比其他类别更难,两个顶尖智能体在每一个类别上都至少得到 0.90。每个智能体都满足至少 91% 的颜色问题,但纹理被满足的比例是 49%–83%,物体类型和状态是接下来最难的。更强的智能体也搭建出更大、更多样的拼搭(附录 C 的表 A1)。在 Model 中,Astra 平均使用 217 个零件、35 种类型、9 种颜色,GLM 则是 27 个零件、10 种类型、5 种颜色。在 Set 中,Qwen、DeepSeek、Muse 和 GLM 平均每件拼搭有 23 到 40 个连通分量,而 Astra 以及两个 Sol 模型和两个 Opus 模型是 2.2 到 4.2,因此它们的场景由多得多的不相连碎块组成。附录 C 的图 A4 和图 A5 按设定画出表 1 和表 A1。
参照集的成本相差 30 倍,名次并不跟着价格走。例如 Muse 的成本是 DeepSeek 的九倍,评分却低 138 点。ELO 对成本的图见图 5(a)。虽然 Align ELO 与 Design ELO 对大多数智能体一致,Sol 在对齐上比设计高 53 点。两个经过训练的基线都大幅低于每一个智能体。BrickNet-14B 只在 26% 的提示上无碰撞,而 BrickGPT 虽然在每一条提示上都有效,却只满足 2% 的问题。样本视觉见图 4,另外十条提示见附录 C 的图 A6。我们观察到,各设定在“什么会坏”上不同。就有效性而言,Set 最难,Muse 降到 0.68,Qwen 降到 0.79,DeepSeek 降到 0.87。对齐对每一个智能体都下降,零件数挤在 400 个零件的下限附近(附录 C 的图 A8),因此许多智能体搭建的是该设定所允许的最小场景。Alt-Build 成本最低,并保持最高的有效性。对齐在 Model 中最高,这也是基线唯一适用的设定。
5.2 环境消融
表 2:环境消融。我们消融 BrickAgent 环境的效应,在三种评测设定上合并(Overall;300 条提示)。两个智能体在获得工具时都稳定地产出有效拼搭,没有工具时则在不同程度上挣扎:GPT-6 Astra 有一定稳健性,但其拼搭的有效比例降到只有 40%,而 GPT-5.6 Luna 降到不足百分之一。该环境提高了 Astra 的 VQA,但其 ELO 的变化落在噪声之内。没有它时,Luna 在两项上都提高,说明可搭建约束限制了表现力。
| 系统 | Valid $\uparrow$ | Collisions $\downarrow$ | Conn. Components | VQA $\uparrow$ | ELO $\uparrow$ | Cost(美元) |
|---|---|---|---|---|---|---|
| GPT-6 Astra | 1.00 | 0.00 | 2.21 | 0.954 | 1297 $\pm$ 22 | 4.06 |
| 去掉 BrickAgent | 0.40 | 7.19 | 6.12 | 0.940 | 1309 $\pm$ 24 | 4.66 |
| GPT-5.6 Luna | 1.00 | 0.00 | 4.60 | 0.792 | 898 $\pm$ 16 | 0.75 |
| 去掉 BrickAgent | $<0.01$ | 155.51 | 83.00 | 0.813 | 960 $\pm$ 20 | 0.60 |
我们在表 2 中消融 BrickAgent 环境,使用同一个智能体 CLI(Codex CLI)、同一个容器和同样的任务要求,但用 LDraw 库以及一份 LDraw 文件格式入门说明代替它的工具。Astra 仍在 40% 的提示上有效,而 Luna 在 300 次里只产出一件有效拼搭。它们的拼搭平均分别有 7 对和 156 对碰撞,并散成 6 个和 83 个连通分量,而有该环境时是 2 个和 5 个。
然而对齐和设计并没有失败。Astra 的 VQA 下降 0.01,其 ELO 的移动落在区间之内。Luna 的两项指标都上升,VQA 上升 0.02,ELO 上升 62 点。没有可搭建性的限制,Luna 做出的拼搭同样好地描绘提示,而且看起来更好,但不能被搭建,这显示了相关验证器的重要性。这样做对 Astra 的对齐或设计没有代价,却让 Luna 在两方面都损失一点。
5.3 对设计评判者的验证
为确认 Design ELO 的有效性——它依赖一个视觉语言模型评判者——我们对照人类评分来评估。我们在 Prolific 上招募参与者,向每人展示 40 对同一提示的拼搭,每件拼搭四个视图。我们从 102 名评分者收集到 4,080 次判断。我们用与 ELO 相同的 Bradley–Terry 模型拟合人类判断(第 4.4 节),并在图 5(b) 中把评分与 Design ELO 比较。排序在智能体之间 36 对中的 34 对上一致,Kendall $\tau$ 为 0.89。这与先前工作的发现一致,该工作表明视觉语言模型与人类偏好在文本到三维生成上对齐(Wu et al., 2024)。评判者比评分者总体更果断,因此我们用一个常数因子把二者对齐。Opus 5.5 和 GPT-6.1 Sol 是在这项研究之后发布的,不属于其中。
5.4 与人类设计的比较
(a)
(b)
图 6:人类设计评测。我们做一项感知研究,把智能体设计与人类设计相比较。对 Model 和 Set 设定中的每一件拼搭,我们从 BrickNet 数据集中选取一件零件数相当的随机拼搭,并请人类评分者认出哪一件是人做的。我们发现评分者能够区分智能体设计的拼搭和人类设计的拼搭(a);这项研究覆盖九个参照智能体和两个基线。虽然智能体设计的拼搭常常满足提示标准,但在细粒度设计上,与人类产出的拼搭之间有明显差距(b)。
我们请熟悉乐高设计的人区分智能体拼搭和人类拼搭(图 6)。对 Model 和 Set 设定中的拼搭,我们从 BrickNet 数据集中抽取零件数匹配的人类设计模型,并询问二者之中哪一件是人做的。抽到的样本并不与提示匹配。BrickBench 的提示不存在人类设计,因此这些配对只在零件数上匹配,图 6(b) 展示的是其他题材的人类模型。与提示匹配的比较需要委托设计,我们留给未来工作。与第 5.3 节一样,这项研究早于 Opus 5.5 和 GPT-6.1 Sol。五名评分者一共提供 360 次评分,并在其中 323 次里选出了人类模型。没有任何一个智能体在五次里有超过一次被当成人类设计师(图 6(a)),每个智能体的比率都显著低于随机。GPT-6 Astra 是最常被当成人类的智能体,在它的 21 对里被选中 4 次。人类设计模型的参照例子见图 6(b)。虽然智能体拼搭很好地满足提示,它们缺少标志人类设计的零件用法、比例和表面细节。
6 讨论与局限
我们从评测中报告四项发现。第一,我们发现,为该任务建造的数据驱动模型被通用智能体所覆盖。一个通用编程智能体在这些模型自己的基准上(第 3.3 节)以及在我们的基准上都超过它们。然而成本仍然是未来工作的一个轴。BrickNet-14B 以一美分的百分之六产出一件拼搭,而 Astra 用 4.06 美元。第二,提示遵从趋于饱和。表现最好的智能体满足向它提出的 95% 的 VQA 问题,绝对对齐并不能有力地区分开顶尖表现者。余量反而在设计质量上。第三,智能体表现依赖于环境。同一个模型用 BrickAgent 能稳定产出可搭建的拼搭,没有它则产出不可搭建的拼搭(表 2)。第四,与人类之间仍有差距。熟悉乐高设计的参与者在十次里有九次把智能体设计的拼搭从人类拼搭中滤出(图 6)。我们把这解释为对设计质量的一种度量:智能体满足要求,但达不到一件经过设计的套装的标准。
我们的物理有效性仿真器是一个代理,而不是结构稳定性的完整度量。连接没有被测试强度,因此一件能平衡的拼搭会通过,即便实物可能会下垂或散开(第 3.2 节)。已有一些工作试图在凸点连接上建立力模型(Waßmann & Weicker, 2012),以评估有限元(Pletz & Drvoderic, 2023)。然而没有一个是通用的,整合它们会严重限制可用的零件目录。在一个通用的出现之前,我们的物理评估门槛是必要的,但不是充分的。
7 结论
我们引入 BrickBench,一个面向智能体式、以文本为条件的乐高套装设计的基准。这个领域给任务一个仿真器能够验证的下限,以及设计质量上开放的上限。它包含三种约束不同的设定中的 300 条提示、一个智能体在其中搭建的参照环境 BrickAgent,以及一套给搭建有效性、对齐和设计打分、并经人类评分者确认的指标。九个前沿智能体对大多数提示搭建出有效拼搭,并满足每条提示所要求的大部分内容,从而取代任务特定的数据驱动模型,代价是成本增加 900 到 6,800 倍。在这样做的同时,我们指出缩小与人类设计差距这一开放挑战。
参考文献
- Bolya et al. (2025)
Daniel Bolya,Po-Yao Huang,Peize Sun,Jang Hyun Cho,Andrea Madotto,Chen Wei,Tengyu Ma,Jiale Zhi,Jathushan Rajasegaran,Hanoona Rasheed,Junke Wang,Marco Monteiro,Hu Xu,Shiyu Dong,Nikhila Ravi,Daniel Li,Piotr Dollár,以及 Christoph Feichtenhofer。
Perception encoder:最好的视觉嵌入并不在网络的输出处。
载于 Advances in Neural Information Processing Systems (NeurIPS),2025。
- Bradley & Terry (1952)
Ralph Allan Bradley 与 Milton E. Terry。
Rank analysis of incomplete block designs:I. 配对比较法。
Biometrika,39(3/4):324–345,1952。
- Cho et al. (2024)
Jaemin Cho,Yushi Hu,Roopal Garg,Peter Anderson,Ranjay Krishna,Jason Baldridge,Mohit Bansal,Jordi Pont-Tuset,以及 Su Wang。
Davidsonian scene graph:提高文本到图像生成细粒度评测的可靠性。
载于 International Conference on Learning Representations (ICLR),2024。
- Chung et al. (2021)
Hyunsoo Chung,Jungtaek Kim,Boris Knyazev,Jinhwi Lee,Graham W. Taylor,Jaesik Park,以及 Minsu Cho。
Brick-by-Brick:用深度强化学习做组合式构造。
载于 Advances in Neural Information Processing Systems (NeurIPS),2021。
- Coumans & Bai (2016–2021)
Erwin Coumans 与 Yunfei Bai。
PyBullet,一个用于游戏、机器人与机器学习的 Python 物理仿真模块。
http://pybullet.org ,2016–2021。
- Ge et al. (2025)
Jiahao Ge,Mingjun Zhou,Hanyou Zheng,Hao Xu,以及 Chi-Wing Fu。
LEGO-maker:自回归的、以图像为条件的乐高模型创建。
ACM Transactions on Graphics (TOG),44(6),2025。
- Gemma Team (2026)
Gemma Team。
Gemma 4 技术报告。
arXiv 预印本 arXiv:2607.02770,2026。
- Gu et al. (2025)
Yunqi Gu,Ian Huang,Jihyeon Je,Guandao Yang,以及 Leonidas Guibas。
BlenderGym:为图形编辑给基础模型系统做基准测试。
载于 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),2025。
- Hu et al. (2024)
Ziniu Hu,Ahmet Iscen,Aashi Jain,Thomas Kipf,Yisong Yue,David A. Ross,Cordelia Schmid,以及 Alireza Fathi。
SceneCraft:一个把三维场景合成为 Blender 代码的 LLM 智能体。
载于 International Conference on Machine Learning (ICML),2024。
- Jimenez et al. (2024)
Carlos E. Jimenez,John Yang,Alexander Wettig,Shunyu Yao,Kexin Pei,Ofir Press,以及 Karthik Narasimhan。
SWE-bench:语言模型能解决真实世界的 GitHub 问题吗?
载于 International Conference on Learning Representations (ICLR),2024。
- Kulits & Schmid (2026)
Peter Kulits 与 Cordelia Schmid。
BrickNet:以图为支撑的生成式积木装配。
载于 Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),pp. 39252–39261,2026 年 6 月。
- Lin et al. (2024)
Zhiqiu Lin,Deepak Pathak,Baiqi Li,Jiayao Li,Xide Xia,Graham Neubig,Pengchuan Zhang,以及 Deva Ramanan。
用图像到文本生成来评测文本到视觉的生成。
载于 European Conference on Computer Vision (ECCV),2024。
- Ma et al. (2025)
Liang Ma,Jiajun Wen,Min Lin,Rongtao Xu,Xiwen Liang,Bingqian Lin,Jun Ma,Yongxin Wang,Ziming Wei,Haokun Lin,Mingfei Han,Meng Cao,Bokui Chen,Ivan Laptev,以及 Xiaodan Liang。
PhyBlock:经由三维积木装配、面向物理理解与规划的渐进式基准。
载于 Advances in Neural Information Processing Systems (NeurIPS),Datasets and Benchmarks Track,2025。
- Mallis et al. (2025)
Dimitrios Mallis,Ahmet Serdar Karadeniz,Sebastian Cavada,Danila Rukhovich,Niki Foteinopoulou,Kseniya Cherenkova,Anis Kacem,以及 Djamila Aouada。
CAD-assistant:工具增强的视觉大语言模型作为通用 CAD 任务求解器。
载于 IEEE/CVF International Conference on Computer Vision (ICCV),2025。
- Pletz & Drvoderic (2023)
Martin Pletz 与 Matthias Drvoderic。
BrickFEM:一个用于简单乐高套装静力学与动力学仿真的自动化有限元模型。
engrXiv 预印本,2023。
10.31224/2898。
- Pun et al. (2025)
Ava Pun,Kangle Deng,Ruixuan Liu,Deva Ramanan,Changliu Liu,以及 Jun-Yan Zhu。
从文本生成物理稳定且可搭建的积木结构。
载于 Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV),pp. 14798–14809,2025 年 10 月。
- Tang et al. (2026)
Kexian Tang,Junyao Gao,Yanhong Zeng,Haodong Duan,Yanan Sun,Zhening Xing,Wenran Liu,Kai Chen,以及 Kaifeng Lyu。
LEGO-puzzles:多模态大语言模型的多步空间推理有多好?
载于 European Conference on Computer Vision (ECCV),2026。
- Tschannen et al. (2025)
Michael Tschannen,Alexey Gritsenko,Xiao Wang,Muhammad Ferjad Naeem,Ibrahim Alabdulmohsin,Nikhil Parthasarathy,Talfan Evans,Lucas Beyer,Ye Xia,Basil Mustafa,Olivier Hénaff,Jeremiah Harmsen,Andreas Steiner,以及 Xiaohua Zhai。
SigLIP 2:具有改进的语义理解、定位与稠密特征的多语言视觉–语言编码器。
arXiv 预印本 arXiv:2502.14786,2025。
- Walsman et al. (2022)
Aaron Walsman,Muru Zhang,Klemen Kotar,Karthik Desingh,Ali Farhadi,以及 Dieter Fox。
Break and make:用乐高积木做交互式结构理解。
载于 European Conference on Computer Vision (ECCV),2022。
- Waßmann & Weicker (2012)
Martin Waßmann 与 Karsten Weicker。
用于乐高结构稳定性分析的最大流网络。
载于 European Symposium on Algorithms (ESA),2012。
- Wu et al. (2024)
Tong Wu,Guandao Yang,Zhibing Li,Kai Zhang,Ziwei Liu,Leonidas Guibas,Dahua Lin,以及 Gordon Wetzstein。
GPT-4V(ision) 是文本到三维生成的、与人类对齐的评估器。
载于 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR),2024。
- Xia et al. (2026)
Tian Xia,Tianrun Gao,Wenhao Deng,Long Wei,Xiaowei Qian,Chenglei Yu,以及 Tailin Wu。
BuildArena:一个面向工程构造、与物理对齐的 LLM 交互式基准。
载于 International Conference on Machine Learning (ICML),2026。
- Xie et al. (2024)
Tianbao Xie,Danyang Zhang,Jixuan Chen,Xiaochuan Li,Siheng Zhao,Ruisheng Cao,Jing Hua Toh,Zhoujun Cheng,Dongchan Shin,Fangyu Lei,Yitao Liu,Yiheng Xu,Shuyan Zhou,Silvio Savarese,Caiming Xiong,Victor Zhong,以及 Tao Yu。
OSWorld:为真实计算机环境中的开放式任务给多模态智能体做基准测试。
载于 Advances in Neural Information Processing Systems (NeurIPS),2024。
- Zhang et al. (2026)
Haozhe Zhang,Kaichen Liu,Miaomiao Chen,Lei Li,Shaojie Yang,Cheng Peng,以及 Hanjie Chen。
BenchCAD:面向程序化 CAD 的综合性工业标准基准。
arXiv 预印本 arXiv:2605.10865,2026。
BrickBench:评测智能体式积木设计
附录
附录 A 提示与问题图
图 A1 按种类和子类型显示每种设定的问题所占份额。Set 的图最大,平均每条提示 24 个问题,因为它们的提示常常描述含有多个物体的场景。
图 A1:VQA 问题类型。我们按 DSG 类型画出每种设定的问题所占份额。
图 A2 完整展示一张 Set 的图,以及生成它的那条提示。它的根是提示所点名的实体,每一个属性和关系问题都挂在确立其所指的那些问题之下,因此一个缺失的实体会使关于它的每一个后续问题都失败。
Set 一只棕色的狗,长着下垂的黑耳朵,戴着一顶小小的棕色帽子,坐在着火房间里的一张桌子旁。一只白色咖啡杯放在它面前。火焰爬上窗帘,围住椅子,但这只狗坐得笔直,爪子平静地搁在桌面上。房间正面敞开,以便露出这一场景。
图 A2:问题图样本。我们画出一条套装提示的问题图样本。从一个问题指向另一个问题的箭头表示,只有评判者对第一个回答“是”,第二个才算被满足。
附录 B 评判提示
图 A3 按评判者收到的样子,复现第 4.4 节的三条提示。两条成对提示的差别在于告诉评判者什么。对齐提示包含那条提示,并问哪一件拼搭覆盖得更多,不论其搭建质量。设计提示扣住那条提示,并问哪一件拼搭设计得更好,不论它描绘什么。VQA 提示列出图中的每一个问题,告诉评判者只根据视图来回答,并要求对每一个问题回答是或否。
Design 第一张图像以拼贴方式展示一件拼搭的每一个视图。第二张图像以同样方式展示另一件拼搭。
你看到两件乐高拼搭。前 4 张图像是拼搭 A,从 4 个角度拍摄。后 4 张图像是拼搭 B,同样的 4 个角度。
选出看起来设计得更好的那一件,对照你对一套官方乐高套装所期望的搭建质量来判断。看零件被用得怎么样,而不是看题材:一件拼搭描绘什么在这里没有分量,你觉得它有多讨喜也没有分量。
两件拼搭都由同一软件、以相同的光照和背景渲染,因此图像质量不携带信息。
只用恰好一个字符作答,A 或 B。不要其他文字。
Alignment 第一张图像以拼贴方式展示一件拼搭的每一个视图。第二张图像以同样方式展示另一件拼搭。
两个人拿到同一段描述,各自用乐高把它搭出来。
描述: [the prompt]
前 4 张图像是拼搭 A,从 4 个角度拍摄。后 4 张图像是拼搭 B,同样的 4 个角度。
选出与描述更匹配的那一件拼搭。把描述逐点过一遍:题材、它说拼搭应当具有的部分、它们的排布,以及它所陈述的任何颜色、数量或关系。覆盖所要求内容更多的那一件胜出,不论其搭建质量。
只用恰好一个字符作答,A 或 B。不要其他文字。
VQA 你看到一件乐高拼搭的 8 个视图,从它周围的 8 个角度拍摄。
它是根据这份简报搭建的: [the prompt]
回答下面关于这一件拼搭的编号问题。把这些视图合起来用——一个特征不必在每一个视图里都可见。只判断你能看见的东西:不要因为简报要求某个细节就假定它存在,也不要从这类物体通常如何制作来推断被遮住的细节。在所有问题之间,保持物体到角色的同一套一致指派。
若视图支持就说 yes,若不支持就说 no。你必须对每一个问题在二者中选一个;没有第三种选项。在证据薄弱处,按八个视图所示的权衡来决定。
[the questions, numbered]
用恰好 [the number of questions] 行结束你的回复,其后不要任何内容,每个问题一行:
<number>: <yes|no>
图 A3:评判提示。第 4.4 节的三条提示,按评判者收到的样子。对两个成对问题,每件拼搭的四个视图被拼贴成一张图像,两张图像位于文本之前,并且设计问题从不包含那条提示。对 VQA,八个视图作为分开的图像位于文本之前,方括号中的字段按每件拼搭填入。
附录 C 补充结果
表 A1 按设定报告拼搭统计。Astra 在每种设定中使用的零件最多,Qwen 第二多。在 Set 中,Qwen、DeepSeek、Muse 和 GLM 平均搭建出 20 到 40 个不相连分量的场景,而 Astra、Opus、Gemini 和 Sol 把它们保持在五个以下。
表 A1:进一步的拼搭统计。我们按设定报告拼搭的进一步统计。Parts 是一件拼搭中的平均零件数。Unique 是(平均的)不重复零件数。Colors 是颜色数。Collisions 是以非物理方式彼此碰撞(重叠)的零件数。Stable 是在仿真下保持静止的拼搭所占比例,每个零件的移动都小于 3 LDU。Conn. Components 是 BrickNet 解析之后的图分量数;一件有效拼搭可以有多个分量,以便表示多个物体。
| 系统 | Parts | Unique | Colors | Collisions $\downarrow$ | Stable $\uparrow$ | Conn. Components |
|---|---|---|---|---|---|---|
| Model | ||||||
| GPT-6 Astra | 217 | 35.4 | 9.4 | 0.00 | 1.000 | 1.6 |
| GPT-6.1 Sol | 230 | 36.4 | 9.1 | 0.00 | 1.000 | 1.2 |
| Claude Opus 5.5 | 182 | 38.2 | 9.1 | 0.00 | 1.000 | 1.3 |
| Claude Opus 5 | 110 | 27.7 | 7.7 | 0.00 | 1.000 | 1.3 |
| Qwen 3.8 Flash | 125 | 23.8 | 8.3 | 0.10 | 0.979 | 4.8 |
| GPT-5.6 Sol | 83 | 20.4 | 8.0 | 0.00 | 1.000 | 1.2 |
| Gemini 3.8 Flash | 95 | 25.6 | 9.6 | 0.00 | 0.990 | 1.2 |
| DeepSeek V4.1 Flash | 88 | 19.3 | 7.0 | 0.56 | 0.969 | 3.1 |
| GPT-5.6 Luna | 41 | 14.8 | 6.8 | 0.00 | 1.000 | 2.0 |
| Muse Spark 1.3 | 56 | 14.5 | 6.7 | 0.46 | 0.925 | 2.0 |
| GLM 5.3 Flash | 27 | 10.3 | 4.9 | 0.86 | 0.928 | 1.7 |
| BrickNet-14B | 40 | 14.5 | 4.8 | 24.80 | – | 1.0 |
| BrickGPT | 139 | 7.1 | 1.0 | 0.00 | 1.000 | 2.4 |
| Set | ||||||
| GPT-6 Astra | 1511 | 46.8 | 17.0 | 0.00 | 1.000 | 2.2 |
| GPT-6.1 Sol | 1625 | 49.1 | 16.7 | 0.00 | 1.000 | 3.5 |
| Claude Opus 5.5 | 1112 | 68.5 | 17.5 | 0.00 | 1.000 | 3.8 |
| Claude Opus 5 | 865 | 48.6 | 14.6 | 0.00 | 1.000 | 4.2 |
| Qwen 3.8 Flash | 1118 | 38.8 | 17.4 | 0.02 | 0.929 | 32.8 |
| GPT-5.6 Sol | 698 | 29.9 | 14.8 | 0.00 | 1.000 | 3.3 |
| Gemini 3.8 Flash | 581 | 36.5 | 17.3 | 0.02 | 0.980 | 1.7 |
| DeepSeek V4.1 Flash | 726 | 33.5 | 12.9 | 6.94 | 0.888 | 36.7 |
| GPT-5.6 Luna | 511 | 26.2 | 13.2 | 0.00 | 1.000 | 10.2 |
| Muse Spark 1.3 | 500 | 19.2 | 11.0 | 9.96 | 0.800 | 22.6 |
| GLM 5.3 Flash | 568 | 16.5 | 9.0 | 0.80 | 0.908 | 40.2 |
| Alt-Build | ||||||
| GPT-6 Astra | 110 | 30.0 | 15.4 | 0.00 | 1.000 | 2.9 |
| GPT-6.1 Sol | 110 | 30.8 | 15.4 | 0.00 | 1.000 | 2.0 |
| Claude Opus 5.5 | 103 | 27.5 | 14.2 | 0.00 | 1.000 | 3.3 |
| Claude Opus 5 | 86 | 25.1 | 12.9 | 0.00 | 1.000 | 1.8 |
| Qwen 3.8 Flash | 105 | 23.3 | 16.0 | 0.00 | 1.000 | 5.1 |
| GPT-5.6 Sol | 52 | 19.3 | 12.1 | 0.00 | 1.000 | 1.4 |
| Gemini 3.8 Flash | 64 | 24.7 | 14.2 | 0.00 | 1.000 | 1.4 |
| DeepSeek V4.1 Flash | 73 | 18.1 | 12.2 | 0.00 | 1.000 | 4.7 |
| GPT-5.6 Luna | 40 | 17.9 | 11.2 | 0.00 | 1.000 | 1.6 |
| Muse Spark 1.3 | 49 | 14.8 | 11.0 | 0.63 | 0.945 | 2.0 |
| GLM 5.3 Flash | 25 | 11.1 | 9.4 | 0.01 | 0.980 | 1.5 |
图 A4 和图 A5 按图 3 的版式、按设定画出表 1 和表 A1,图 A6 对进一步的提示展示每个智能体的一件拼搭。
(a)
(b)
图 A4:BrickBench。我们可视化拆开的 BrickBench 定量结果。基线 BrickNet-14B(Kulits & Schmid, 2026)和 BrickGPT(Pun et al., 2025)只在 Model 设定上评测,所报告的 BrickNet-14B 的 Valid 指标不包含稳定性。
(a)
(b)
图 A5:进一步的拼搭统计。我们按设定画出表 A1 的统计。
Model 一道扭转的灰色龙卷风在一片翻腾的水面上方收成一个细点。三条小鲨鱼从漏斗的不同高度探出,身体朝不同方向倾斜。白色的腹部、鳍和张开的颌打断旋转的灰色带,上方是一大片风暴云盖。
Model 一只剑齿松鼠被困在一块清澈的蓝色冰块里。它的长吻、巨大的眼睛和卷曲的蓬松尾巴透过冰仍然可见。一只爪子从一个化开的开口伸向一颗棕色橡果,橡果就躺在它指尖之外。一小摊水围着冰块底部。
Model 一只破损的红色狐狸机械动画有一只眼罩、一个长而多牙的吻,以及一只被金属钩替换的手。撕开的毛皮露出膝盖和胸口的灰色机械零件。它穿着破烂的棕色短裤,大金属脚分开站着。一只耳朵损坏,让这张本来就歪的脸显得更不体面。
Set 一座剖开的中世纪门楼里有一架木制投石机,吊索里坐着一头黑白花奶牛。一个戴头盔的守卫站在释放杆旁边。关上的大门外面,三名骑士从盾牌后面抬头看。第二头奶牛在庭院里的一捆干草旁等着。
Set 一个长方形玻璃鱼缸,黑色缸沿,彩色砾石。三条橙色的鱼和一条条纹神仙鱼在高大的绿色植物和一道石拱之间游动。一只蜗牛贴在内侧玻璃上,一台小过滤器占据与石拱相对的一角。
Set 一个赤脚的武术家,穿着白色制服、黑腰带和红色头带,在一座临水平台上砸一辆停着的轿车。车盖皱了,车窗破了,一扇门歪斜地挂在车身上。斗士一只拳头打进损坏的车头。港口的水和系泊桩立在残骸后面。
Set 四个小小的孩子围着一块比他们还高、夹着奶油的饼干,处在巨大草叶的丛林里。两个坐在一只巨大的棕色蚂蚁背上,另一个从饼干上掰下一粒碎屑。第四个朝一只丢弃的汽水拉环的开口里看。露珠沾在他们上方的草上。
Alt-Build 一艘渡轮,敞开的甲板上载着一辆汽车。它的前跳板停在岸上,一个小小的控制舱立在甲板后部上方。
Alt-Build 一头粉色的猪坐在一辆灰色矿车里。它的前腿搁在车沿上,吻部伸到车子之外。
Alt-Build 一棵树分成两根树枝,中间有一个巢。两只小鸟坐在巢里。一只更大的鸟停在一根树枝上。
GPT-6 Astra,GPT-6.1 Sol,Claude Opus 5.5,Claude Opus 5,Qwen 3.8 Flash,GPT-5.6 Sol,Gemini 3.8 Flash,DeepSeek V4.1 Flash,GPT-5.6 Luna,Muse Spark 1.3,GLM 5.3 Flash
图 A6:更多 BrickBench 样本。我们展示十一个智能体在三种设定中的进一步拼搭。
图 A7 按拼搭类别和按属性类型分解 VQA。
(a)按提示类别
(b)按属性类型
图 A7:VQA 分解。我们按提示类别(a)和属性类型(b)报告分数。
图 A8 画出 Model 和 Set 中零件数的分布。大多数智能体的峰值靠近 Set 的 400 个零件下限,Astra 是例外。
(a)Model
(b)Set
图 A8:零件数分布。我们报告每个智能体在 Model($\leq$ 400)和 Set(400–4000)设定中零件数的密度。大多数智能体在 Set 中的峰值靠近 400。GPT-6 Astra 在两种设定中平均使用的零件都明显更多。
觉得有用,转给同事
微信扫码
用微信扫一扫,在手机上打开后即可转发。