研究与基准测试44 分钟
行业与实践 · 研究与基准测试
最新优先最早优先
我们自己跑的基准,和对公开数据的核对。结论附带方法与局限。
查看全部研究与基准测试39 分钟
BabelArena:面向大语言模型智能体的大规模多语言基准
研究与基准测试33 分钟
生产环境中的高效基准评测:一项关于持续演进的大语言模型智能体的研究
研究与基准测试55 分钟
干净分数、被埋没的证据与自信的错误:对前沿智能体问答的回执式审计
研究与基准测试21 分钟
智能体评测中的政策漏洞:当政策歧义伪装成智能体错误
研究与基准测试53 分钟
当智能体指标所度量的并非同一事物:对 Praxa AI 流水线的证据锚定审计
研究与基准测试32 分钟
仅仅完成任务是不够的:在不断累积的挑战下评估智能体的运行韧性与体贴式参与
研究与基准测试38 分钟
τ-bench:真实世界领域中工具–智能体–用户交互基准
研究与基准测试31 分钟
衡量人工智能完成长时软件任务的能力
研究与基准测试36 分钟
BenchShield:面向大语言模型智能体评测基础设施奖励完整性的形式化模型支撑插桩(上篇)
研究与基准测试28 分钟
BenchShield:面向大语言模型智能体评测基础设施奖励完整性的形式化模型支撑插桩(下篇)