Skip to main content

功能说明

对应工具标识 content_safety。 content_safety 是 VeADK 基于智能体插件机制提供的内容安全护栏工具:它挂到智能体执行流程的回调上,借助火山大模型应用防火墙对各阶段内容做合规审查,拦截不安全的输入与输出。 目前已生效的审计点:
  • Before Model Callback——发送给模型前审查用户输入
  • After Model Callback——审查模型输出
  • Before Tool Callback——工具调用前审查入参
  • After Tool Callback——审查工具返回
content_safety 基于火山大模型应用防火墙的多种内容安全策略,对不同类型的风险内容进行检测和拦截。风险内容的一级分类如下: 其中:
  • 通用话题控制策略在添加资产时不会默认配置,需要添加后自行配置话题控制防护策略;
  • 算力消耗策略并非单次触发即生效:当系统监测到相似攻击向量并伴随高算力输出的行为模式时,才会对该类输入请求进行拦截。

环境变量与前提

使用前先购买实例、添加资产并获取 AppID。设置环境变量 TOOL_LLM_SHIELD_APP_ID,或在 config.yaml 中配置:
config.yaml

使用方法

把 content_safety 的回调挂到智能体上,即可对执行过程进行审计:

额外说明

内容安全护栏的调试日志不会记录 API Key 值。生产环境仍应通过环境变量或密钥管理服务提供凭证,并限制日志访问权限。
最后修改于 2026年9月19日