功能说明
对应工具标识content_safety。
content_safety 是 VeADK 基于智能体插件机制提供的内容安全护栏工具:它挂到智能体执行流程的回调上,借助火山大模型应用防火墙对各阶段内容做合规审查,拦截不安全的输入与输出。
目前已生效的审计点:
- Before Model Callback——发送给模型前审查用户输入
- After Model Callback——审查模型输出
- Before Tool Callback——工具调用前审查入参
- After Tool Callback——审查工具返回
content_safety 基于火山大模型应用防火墙的多种内容安全策略,对不同类型的风险内容进行检测和拦截。风险内容的一级分类如下:
其中:
- 通用话题控制策略在添加资产时不会默认配置,需要添加后自行配置话题控制防护策略;
- 算力消耗策略并非单次触发即生效:当系统监测到相似攻击向量并伴随高算力输出的行为模式时,才会对该类输入请求进行拦截。
环境变量与前提
使用前先购买实例、添加资产并获取 AppID。设置环境变量TOOL_LLM_SHIELD_APP_ID,或在 config.yaml 中配置:
config.yaml
使用方法
把content_safety 的回调挂到智能体上,即可对执行过程进行审计: