Not translated yet — showing the Chinese originals.
Industry & Practice · Tagged “CC BY”
Research & Benchmarks//15 min
大语言模型(LLM)越来越多地被用来生成需求规格、设计文档、代码和测试用例。相比之下,一个更难的保障问题得到的关注少得多:静态地验证已实现的代码是否满足用自然语言写成的需求。Coverity、SonarQube 这类传统
Research & Benchmarks//28 min
大型语言模型(LLM)在自动化单元测试生成方面已展现出相当大的潜力,但相对于人工编写测试的实际有效性仍然缺乏充分理解。现有评估通常依赖于面向覆盖率的基准测试,这些基准并不直接评估故障检测能力。我们提出了一项对 LLM 生
Research & Benchmarks//30 min
基于大语言模型(LLM)的智能体正越来越多地用于复杂任务,如软件测试和网络安全评估。虽然这些智能体展现出令人印象深刻的能力,但它们的行为难以理解、解释和分析。现有评估主要集中在任务成功率和执行轨迹上,对智能体所采用的策略
Research & Benchmarks//35 min
大语言模型(LLM)在自动化、分析和解释软件工程任务(如软件测试)方面展现出强大的潜力。基于模型的测试(MBT)是一种软件测试技术,其广泛的规模化挑战阻碍了工业界的采用。本文提出了一项关于使用大语言模型进行自动化基于模型
Research & Benchmarks//42 min
大语言模型(LLMs)被用作序列决策策略的事后解释器,生成关于为何选择某个动作的自然语言解释。然而,LLMs 经常生成看似合理但不正确的陈述,而且目前没有方法系统性地测试这些解释是否忠实于底层环境。两个经典的软件测试挑战
Research & Benchmarks//32 min
强化学习(RL)通过可执行反馈显著推进了代码大语言模型(LLM)的发展。针对编程问题的反馈主要来自特定测试用例,而高质量测试用例往往稀缺,因为它们必须同时具备健全性(sound)和判别力(discriminative)。
Research & Benchmarks//42 min
并发有状态库 API 通过不断演变的资源所有权、生命周期状态和竞争的交错执行来暴露其行为。大型语言模型可以合成可执行的 Rust 测试,但其输出常常违反 API 前置条件、保持浅层状态,或将并发性退化为偶然的顺序追踪。相
Research & Benchmarks//44 min
大语言模型(Large Language Models, LLMs)正越来越多地用于软件工程工作流,以自动生成源代码及其对应的测试套件。这种双重能力催生了新的开发范式,包括测试先行工作流与智能体工作流:由同一个模型负责产
Research & Benchmarks//51 min
形式化契约对软件测试与验证至关重要,但编写它们仍然费力且容易出错。大语言模型(LLM)为自动形式化提供了一条有前景的路径:从自然语言规约综合出可执行断言,从而弥合开发者的非正式意图与形式化可执行规约之间的鸿沟。我们提出
Research & Benchmarks//67 min
大语言模型(Large Language Model,LLM)代码智能体越来越多地通过迭代编辑代码、调用工具并验证候选补丁,来解决仓库级问题。在这些工作流中,智能体常常即兴编写测试,但这一行为的价值仍不清楚。例如,GPT
Research & Benchmarks//55 min
许多网络协议实现中的软件缺陷出现在规范边界附近,例如刚好落在允许范围之内或之外的输入,或者单独看来合法、但在给定状态下非法的报文。从 SSL Heartbleed 漏洞到 TCP 圣诞树数据包,边界输入一再暴露关键弱点,
Research & Benchmarks//60 min
复现测试帮助开发者确认所报告的问题,并为问题修复提供可执行反馈,但开源项目中的问题报告很少包含这类测试。近期研究探索了用大语言模型从问题报告生成问题复现测试,但现有方法大体依赖基于提示的流水线:检索文本上下文并生成测试。
Research & Benchmarks//63 min
近年来,大语言模型(Large Language Models, LLMs)的出现推动了自动化单元测试生成研究的迅速增长,取得了令人瞩目的性能,并减少了人工投入。然而,现有基于大语言模型的方法仍存在两项主要局限:(1)它
Research & Benchmarks//20 min
测试用例合成对于评估与排序大语言模型(LLM)生成的程序至关重要。然而,构造高质量测试用例仍然困难,因为可靠的期望输出往往难以获得。我们提出置信度门控直推式测试生成(Confidence-Gated Transducti
Research & Benchmarks//41 min
大规模代码数据集的广泛可得,推动了面向代码相关任务的大语言模型(large language models,LLMs)快速发展。这些数据集可能包含敏感的个人可识别信息(personally identifiable in
Research & Benchmarks//28 min
自动化单元测试生成近来受益于大语言模型(LLM)的进展,但我们的工业部署表明,有前景的研究结果与实际可用性之间仍存在持续差距。在具有复杂框架与跨文件依赖的真实项目中,LLM 生成的测试经常无法编译、需要高成本的人工修复,
Research & Benchmarks//46 min
上下文至关重要:提升基于大语言模型的单元测试生成的实用可靠性(下)(中文全译)
Research & Benchmarks//28 min
大语言模型(LLM)的最新进展,推动了利用 LLM 自动生成测试的研究兴趣。既有工作通常用代码覆盖率、变异分数等代理指标来评估所生成的测试套件。然而,Inozemtseva 等人以及 Papadakis 等人的研究表明:
Research & Benchmarks//46 min
LLM 生成测试套件的覆盖率与变异分数是否与其有效性相关(下)(中文全译)
Research & Benchmarks//48 min
尽管大语言模型(Large Language Models, LLMs)在自动化单元测试生成方面展现出巨大潜力,近期研究指出:当提示中给出的是含缺陷代码时,所生成测试的质量会受到负面影响。本文提出一项新指标,用于定量度量