EvalMesh
分布式 LLM 评测调度,把评测任务打散到多家模型供应商。
What each tool does, what it costs, whether it ships an agent-facing surface, and whether it is still alive.
分布式 LLM 评测调度,把评测任务打散到多家模型供应商。
面向 LLM 应用的开源红队框架,自带 agent 技能。
按需拉起的临时测试环境,每个 PR 一套。
真机云,支持 agent 通过 MCP 申领设备并回传录屏。
穷尽执行路径的确定性模拟测试。
原生基于 pytest 的 LLM 评测,60 多种指标。
LLM 追踪与评测,可在 ELv2 许可下自托管。
Elastic License 2.0,并非 OSI 认可的开源许可:允许自托管,不允许作为托管服务转售。
统一的 Web、API、性能和可访问性测试,带自愈能力。
用自然语言编写测试,覆盖 Web、移动端、桌面、邮件、短信和主机系统。
把 AI agent 纳入治理与可追溯体系的测试平台。
Agent 生态事实上的标准浏览器自动化框架。
用 eBPF 捕获流量,回放为带 mock 的集成测试。
为 agent 刚写出的代码提供验证基础设施。
客户包括 OpenAI、Suno、Clay 和 Dust。
“人工 + AI”即服务,交付归你所有的 Playwright 代码。
模拟真实用户会话,对变更前后进行视觉 diff。
总部位于伦敦。2026 年 7 月完成 1500 万美元 A 轮融资,由 Chemistry 领投,Menlo 参投;自称 ARR 同比增长 5 倍。
Agentic 端到端测试,在运行时解析意图而非生成代码。
2025-11-24 完成 1500 万美元 A 轮融资,由 Standard Capital 领投,Dropbox Ventures 参投。自称每月执行 2 亿多个测试步骤。