研究与基准测试/2026-08-17/8 分钟告警多不等于风险准:阿里云 AgentLoop 先把高风险队列做实阿里云 2026-08-17 的 AgentLoop Audit 把局部命中和上下文判定分开。截图里凭证泄漏影响 6 个应用,模型侧 38 次提交、43 次回复泄漏。这些是运营计数,不是检出率。
研究与基准测试/2026-07-23/9 分钟Coding Agent 上线前先要能被量:阿里云 Pilot 用轨迹回答四件事阿里云 2026-07-23 开源 LoongSuite Pilot。它不改 Agent,把本机 Coding Agent 收成统一轨迹,用来定义完成率、Token 效率和自修复,并做安全审计。三工具对比只是同一次补单测,没有重复实验。
研究与基准测试/2026-07-16/10 分钟人均 Token 会骗人:阿里云用八段看板看组织有没有真用上阿里云 2026-07-16 用 Pilot 和 SLS 把 AI Coding 收成八段组织看板。DORA 的 39% ROI 是引用的模型数。看板截图写明是模拟数据。前 10% 超过 70% Token 只是判断线。