研究与基准测试/2026-08-17/8 分钟告警多不等于风险准:阿里云 AgentLoop 先把高风险队列做实阿里云 2026-08-17 的 AgentLoop Audit 把局部命中和上下文判定分开。截图里凭证泄漏影响 6 个应用,模型侧 38 次提交、43 次回复泄漏。这些是运营计数,不是检出率。
研究与基准测试/2026-07-23/9 分钟Coding Agent 上线前先要能被量:阿里云 Pilot 用轨迹回答四件事阿里云 2026-07-23 开源 LoongSuite Pilot。它不改 Agent,把本机 Coding Agent 收成统一轨迹,用来定义完成率、Token 效率和自修复,并做安全审计。三工具对比只是同一次补单测,没有重复实验。