Softonic 评论

针对人工智能代理出口测试和验证的专业基准

agent-egress-bench,由LuckyPipewrench创建,是一个开源基准测试和攻击语料库,用于验证自主代理的出站控制。它运行一套结构化的测试,以测量防火墙、代理或MCP包装器在阻止外泄、提示注入和基于工具的攻击方面的效果。关键元素包括一个250多个测试案例的语料库、一个工具中立的运行器和一个自动评分方法。目标用户是寻求基于证据的出站保证的AI安全研究人员、防火墙开发人员和企业安全架构师。

你实际上可以用它做什么任务?

基准定义了一个明确的工作:测量自主代理的出口保护。该项目将一个大型攻击语料库与一个运行器配对,以在多个类别中测试适配器,并明确涵盖DLP规避、提示注入、SSRF、shell混淆以及特定于MCP的向量,如工具中毒和模式注入。用户可以使用基准生成可重复的攻击运行和性能数据,反映代理的出站策略如何响应真实的对抗模式。

它如何报告准确性,限制在哪里?

该项目包括一种自动评分方法,报告攻击阻止和误报率,提供可量化的决策指标。运行器在每个案例中记录决策,因此团队可以检查哪些输入触发了检测。准确性取决于被测试适配器的集成质量;基准本身报告结果,但不改变产品的内部检测逻辑,因此结果需要安全团队进行解释。

它需要什么输入、协议和环境?

运行器是用Go编写的,设计为在Linux上运行,语料库测试MCP、HTTP和WebSocket流量。通过能力配置文件或适配器实现兼容性,因此任何提供适配器接口的安全工具都可以进行测试。代码库和数据采用Apache-2.0许可证,允许在组织的测试环境中进行检查和本地部署。

它对典型的安全工作流程实用吗?

该基准旨在面向技术熟练的团队:AI安全研究人员、AI防火墙和代理的开发人员,以及企业架构师,符合所述目标受众。其工具中立设计和适配器模型使安全团队能够评估多个产品,而不受供应商锁定的限制。实际限制包括严格关注出站代理行为,而不是全栈漏洞扫描,并期望团队将运行器集成到现有的CI或审计工作流程中。

实用的、以证据为中心的工具,适用于专业安全团队

基准是一个务实的选择,适合需要可验证的出口测试并准备将命令行运行程序纳入审计工作流程的团队。它的证据导向支持严格的安全保证,而寻求以GUI为首或通用网络扫描仪的组织应预计更高的集成工作量。对于专注于自主代理外部风险的团队,它可靠地提高了操作测试的严格性。

  • 赞成

    • 包含超过250个逻辑测试用例,涵盖18个安全类别
    • 工具中立的手套式跑步者与适配器兼容的产品一起工作
    • 自动评分报告攻击阻止和误报率
    • 用于本地检查和重用的Apache-2.0许可代码和数据
  • 反对

    • Runner 目标 Linux 环境,限制了开箱即用的跨平台使用
    • 专注于出口;不是全面周边扫描的替代品
    • 需要适配器集成和安全测试经验来解释结果

应用参数

  • 开发者

  • 许可证

    免费

  • 版本

    v1.0.0

  • 更新日期

  • 平台

    MCP

  • 语言

    英语

应用程式 提供其他语言版本



用户对 agent-egress-bench 的评分

您是否尝试过 agent-egress-bench?成为第一个离开您的意见!

添加评论
有关使用此软件的法律因国家/地区而异。 如果违反这些法律,我们不鼓励或纵容此程序的使用。
已使用 登录 Softonic