LLM Evaluation
EvalMesh
MCP
分布式 LLM 评测调度,把评测任务打散到多家模型供应商。
What each tool does, what it costs, whether it ships an agent-facing surface, and whether it is still alive.
分布式 LLM 评测调度,把评测任务打散到多家模型供应商。
面向 LLM 应用的开源红队框架,自带 agent 技能。
真机云,支持 agent 通过 MCP 申领设备并回传录屏。
原生基于 pytest 的 LLM 评测,60 多种指标。
LLM 追踪与评测,可在 ELv2 许可下自托管。
Elastic License 2.0,并非 OSI 认可的开源许可:允许自托管,不允许作为托管服务转售。
声明式 LLM 评测与红队测试,质量回退即让构建失败。
2026-03-09 被 OpenAI 收购;团队承诺继续保持 MIT 许可,相关技术并入 OpenAI Frontier。收购时拥有 125,000 多名开发者和 30 多家财富 500 强客户。
Agent 生态事实上的标准浏览器自动化框架。
用 eBPF 捕获流量,回放为带 mock 的集成测试。