研究与基准测试15 分钟
行业与实践 · 研究与基准测试
最新优先最早优先
我们自己跑的基准,和对公开数据的核对。结论附带方法与局限。
查看全部研究与基准测试28 分钟
LLM 与人工单元测试:在真实 Python 缺陷上的故障检测能力
研究与基准测试30 分钟
ATLAS:通过 LLM 引导的抽象和自动机学习发现智能体策略
研究与基准测试35 分钟
使用大语言模型进行自动化基于模型的测试生成的实证评估
研究与基准测试42 分钟
使用模型检查作为预言机的基于大语言模型的事后解释器自动化测试
研究与基准测试32 分钟
代码大语言模型中健全且对抗性测试生成的两阶段强化学习
研究与基准测试42 分钟
从资源流到可执行测试:Petri 网指导的并发有状态 Rust API 大语言模型测试生成
研究与基准测试49 分钟
评估基于大语言模型的端到端 CLI 工具场景中的从零到一软件生成
研究与基准测试44 分钟
先写代码再测试的风险:一项关于基于大语言模型的测试生成工作流的实证研究
研究与基准测试51 分钟
自然语言断言的忠实自动形式化
研究与基准测试67 分钟
重新思考智能体生成测试对基于大语言模型的软件工程智能体的价值
研究与基准测试55 分钟
CornerCase:协议实现的自动化极值测试
研究与基准测试60 分钟
ReProAgent:从问题报告生成缺陷复现测试的工具增强多阶段智能体方法
研究与基准测试63 分钟
通过人类测试启发工作流实现单元测试生成的多智能体大语言模型协作
研究与基准测试20 分钟
面向代码重排序的置信度门控直推式测试生成
研究与基准测试41 分钟
通过测试生成探测基于大语言模型的代码生成中的隐私泄露
研究与基准测试28 分钟
上下文至关重要:提升基于大语言模型的单元测试生成的实用可靠性(经验论文)(上篇)
研究与基准测试46 分钟
上下文至关重要:提升基于大语言模型的单元测试生成的实用可靠性(下篇)
研究与基准测试28 分钟
LLM 生成测试套件的覆盖率与变异分数是否与其有效性相关?(可复现性研究)(上篇)
研究与基准测试46 分钟
LLM 生成测试套件的覆盖率与变异分数是否与其有效性相关(下篇)