OpenQA

Not translated yet — showing the Chinese originals.

Industry & Practice · Tagged “论文翻译”

Newest firstOldest first
  • Research & Benchmarks44 min

    MCP-GRANITE 基准:面向基于 MCP 的大语言模型智能体的粒度接口测试

  • Research & Benchmarks39 min

    BabelArena:面向大语言模型智能体的大规模多语言基准

  • Research & Benchmarks33 min

    生产环境中的高效基准评测:一项关于持续演进的大语言模型智能体的研究

  • Research & Benchmarks55 min

    干净分数、被埋没的证据与自信的错误:对前沿智能体问答的回执式审计

  • Research & Benchmarks21 min

    智能体评测中的政策漏洞:当政策歧义伪装成智能体错误

  • Research & Benchmarks38 min

    τ-bench:真实世界领域中工具–智能体–用户交互基准

  • Research & Benchmarks31 min

    衡量人工智能完成长时软件任务的能力

  • Research & Benchmarks28 min

    LLM 与人工单元测试:在真实 Python 缺陷上的故障检测能力

  • Research & Benchmarks30 min

    ATLAS:通过 LLM 引导的抽象和自动机学习发现智能体策略

  • Research & Benchmarks35 min

    使用大语言模型进行自动化基于模型的测试生成的实证评估

  • Research & Benchmarks42 min

    使用模型检查作为预言机的基于大语言模型的事后解释器自动化测试

  • Research & Benchmarks32 min

    代码大语言模型中健全且对抗性测试生成的两阶段强化学习

  • Research & Benchmarks49 min

    评估基于大语言模型的端到端 CLI 工具场景中的从零到一软件生成