Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “论文翻译”
Research & Benchmarks//44 min
随着大语言模型(LLM)智能体越来越多地通过 MCP 等标准化协议与外部工具交互,工具接口设计成为一个关键却研究不足的因素。功能如何被分解为工具,会影响智能体能否选对工具并构造出合法参数。这一选择在边缘侧尤其关键:资源约束限制了哪些模型可以
Research & Benchmarks//39 min
大语言模型(LLM)智能体越来越多地通过工具使用以及与用户和环境的交互来执行多步骤工作流。然而,现有智能体评测大体以英语为中心,限制了我们对智能体在多语言场景下能力的理解。我们提出 BabelFlow,一套与具体基准无关的智能体化工作流:它
Research & Benchmarks//33 min
生产环境中的大语言模型智能体在持续演进中会被反复评测,但完整的智能体基准每次重跑代价很高。我们研究一种服务于每月数万活跃用户的生产分析智能体的高效重复评测,并报告一手部署经验。我们使用该生产基准的 574 次历史运行,按时间顺序划分为标定期
Research & Benchmarks//55 min
前沿模型在浅层文档/图表阅读任务上得分很高。在一次受控的数据室审计中,把证据移入埋没条件后,准确率下降,强制声明增加,工具调用增加,每个正确答案的成本也增加。置信度与基准校准并不能完全抓住错误答案;一起有记录的生产事故表明,捏造的结构性主张
Research & Benchmarks//21 min
智能体基准评测政策遵从,却假定每一条政策都能确定唯一正确的动作。自然语言政策会因沉默、歧义或自相矛盾而违背这一假定,从而允许多种站得住脚的解读,而单一金标准轨迹无法覆盖这些解读。我们对 τ²-bench 的两个领域做了审计,建立了此类政策漏
Research & Benchmarks//53 min
智能体评测在数值上可以是正确的,同时所度量的构念却不同于其标签所暗示的构念。我们对选定的 Praxa AI 实现文件、历史评测产物与运行记录做了一项回顾性度量审计。一份含 139 个用例的离线路由报告有 112 次通过、27 次失败,尽管门
Research & Benchmarks//32 min
生成式人工智能智能体的持续部署,所要求的不止是孤立任务上的成功。智能体必须在反复交互、条件变化,以及对共享工作流中人员的依赖之下仍然有用,尤其是当技术、人员与运营方面的扰动随时间累积时。我们提出**运行韧性**(operational re
Research & Benchmarks//38 min
现有基准并不检验语言智能体与人类用户的交互,也不检验其遵循特定领域规则的能力,而这两者对于把它们部署到真实世界应用都至关重要。我们提出 τ-bench,这一基准模拟用户(由语言模型模拟)与语言智能体之间的动态对话;该智能体配备领域专用的 A
Research & Benchmarks//31 min
尽管人工智能基准测试进步迅速,基准成绩在现实世界中究竟意味着什么,仍然不清楚。为了用人类能力来量化人工智能系统的能力,我们提出一项新指标:50% 任务完成时间视界(50%-task-completion time horizon),即人工智
Research & Benchmarks//36 min
BenchShield 讨论如何用形式化模型支撑的插桩,检查智能体评测里的奖励是否被篡改。
Research & Benchmarks//28 min
BenchShield 讨论如何用形式化模型支撑的插桩,检查智能体评测里的奖励是否被篡改。
Research & Benchmarks//15 min
大语言模型(LLM)越来越多地被用来生成需求规格、设计文档、代码和测试用例。相比之下,一个更难的保障问题得到的关注少得多:静态地验证已实现的代码是否满足用自然语言写成的需求。Coverity、SonarQube 这类传统
Research & Benchmarks//28 min
大型语言模型(LLM)在自动化单元测试生成方面已展现出相当大的潜力,但相对于人工编写测试的实际有效性仍然缺乏充分理解。现有评估通常依赖于面向覆盖率的基准测试,这些基准并不直接评估故障检测能力。我们提出了一项对 LLM 生
Research & Benchmarks//30 min
基于大语言模型(LLM)的智能体正越来越多地用于复杂任务,如软件测试和网络安全评估。虽然这些智能体展现出令人印象深刻的能力,但它们的行为难以理解、解释和分析。现有评估主要集中在任务成功率和执行轨迹上,对智能体所采用的策略
Research & Benchmarks//35 min
大语言模型(LLM)在自动化、分析和解释软件工程任务(如软件测试)方面展现出强大的潜力。基于模型的测试(MBT)是一种软件测试技术,其广泛的规模化挑战阻碍了工业界的采用。本文提出了一项关于使用大语言模型进行自动化基于模型
Research & Benchmarks//42 min
大语言模型(LLMs)被用作序列决策策略的事后解释器,生成关于为何选择某个动作的自然语言解释。然而,LLMs 经常生成看似合理但不正确的陈述,而且目前没有方法系统性地测试这些解释是否忠实于底层环境。两个经典的软件测试挑战
Research & Benchmarks//32 min
强化学习(RL)通过可执行反馈显著推进了代码大语言模型(LLM)的发展。针对编程问题的反馈主要来自特定测试用例,而高质量测试用例往往稀缺,因为它们必须同时具备健全性(sound)和判别力(discriminative)。
Research & Benchmarks//42 min
并发有状态库 API 通过不断演变的资源所有权、生命周期状态和竞争的交错执行来暴露其行为。大型语言模型可以合成可执行的 Rust 测试,但其输出常常违反 API 前置条件、保持浅层状态,或将并发性退化为偶然的顺序追踪。相
Research & Benchmarks//49 min
大型语言模型(LLM)的演进催生了向意图驱动软件开发范式的转变,其中自主智能体被期望从头开始设计并交付完整的、可运行的软件系统。然而,由于两个根本性局限,现有基准测试未能充分评估这种从零到一的生成能力。首先,它们依赖于预
Research & Benchmarks//44 min
大语言模型(Large Language Models, LLMs)正越来越多地用于软件工程工作流,以自动生成源代码及其对应的测试套件。这种双重能力催生了新的开发范式,包括测试先行工作流与智能体工作流:由同一个模型负责产