研究与基准测试研究与基准测试/2026-09-27/49 分钟评估基于大语言模型的端到端 CLI 工具场景中的从零到一软件生成大型语言模型(LLM)的演进催生了向意图驱动软件开发范式的转变,其中自主智能体被期望从头开始设计并交付完整的、可运行的软件系统。然而,由于两个根本性局限,现有基准测试未能充分评估这种从零到一的生成能力。首先,它们依赖于预