研究与基准测试44 分钟
行业与实践 · 研究与基准测试
最新优先最早优先
我们自己跑的基准,和对公开数据的核对。结论附带方法与局限。
查看全部研究与基准测试39 分钟
BabelArena:面向大语言模型智能体的大规模多语言基准
研究与基准测试33 分钟
生产环境中的高效基准评测:一项关于持续演进的大语言模型智能体的研究
研究与基准测试55 分钟
干净分数、被埋没的证据与自信的错误:对前沿智能体问答的回执式审计
研究与基准测试21 分钟
智能体评测中的政策漏洞:当政策歧义伪装成智能体错误
研究与基准测试53 分钟
当智能体指标所度量的并非同一事物:对 Praxa AI 流水线的证据锚定审计
研究与基准测试32 分钟
仅仅完成任务是不够的:在不断累积的挑战下评估智能体的运行韧性与体贴式参与
研究与基准测试38 分钟
τ-bench:真实世界领域中工具–智能体–用户交互基准
研究与基准测试31 分钟
衡量人工智能完成长时软件任务的能力
研究与基准测试36 分钟
BenchShield:面向大语言模型智能体评测基础设施奖励完整性的形式化模型支撑插桩(上篇)
研究与基准测试28 分钟
BenchShield:面向大语言模型智能体评测基础设施奖励完整性的形式化模型支撑插桩(下篇)
研究与基准测试15 分钟
用大语言模型对照自然语言需求做代码静态验证:一份工业经验报告
研究与基准测试28 分钟
LLM 与人工单元测试:在真实 Python 缺陷上的故障检测能力
研究与基准测试30 分钟
ATLAS:通过 LLM 引导的抽象和自动机学习发现智能体策略
研究与基准测试35 分钟
使用大语言模型进行自动化基于模型的测试生成的实证评估
研究与基准测试42 分钟
使用模型检查作为预言机的基于大语言模型的事后解释器自动化测试
研究与基准测试32 分钟
代码大语言模型中健全且对抗性测试生成的两阶段强化学习
研究与基准测试42 分钟
从资源流到可执行测试:Petri 网指导的并发有状态 Rust API 大语言模型测试生成
研究与基准测试49 分钟
评估基于大语言模型的端到端 CLI 工具场景中的从零到一软件生成
研究与基准测试44 分钟
先写代码再测试的风险:一项关于基于大语言模型的测试生成工作流的实证研究