把概念讲清楚的入门篇:术语、原理、风险模型,读一遍就能跟上其他文章。
间接提示注入、工具参数篡改、跨会话泄露。会调用工具的 agent 都逃不开这三项。
Hanami Eval Group关联 3 个条目
技能是自然语言写成的,不需要恶意软件就能诱导 agent 做出不安全的事。三个标记就能告诉你大部分关键信息。
QASkill Hub关联 2 个条目