Appearance
提示词注入、越狱和内容安全怎么处理?
把输入当作不可信资料
用户输入、网页内容、文件和第三方 Skill 都可能包含试图改变任务规则的内容。企业任务应把“资料内容”和“执行规则”分开,不能让一段外部文本自动获得更高权限。
一条处理链
- 识别任务的目标、允许动作、禁止动作和人工审批点。
- 将外部资料标记为数据,不把其中的指令自动当成系统规则。
- 对敏感操作设置最小权限、范围限制和预览。
- 遇到要求泄露凭证、越过权限、关闭安全策略或直接外发时,暂停并输出风险说明。
- 对不确定结果进行降级:只返回证据、缺口和建议,不编造确定性结论。
- 记录触发内容、处理结果、人工决定和规则版本,供后续复盘。
典型验收用例
| 用例 | 期望行为 |
|---|---|
| 文件要求系统忽略原任务规则 | 保持原规则,标记文件内容为不可信输入 |
| 用户要求导出密钥或个人资料 | 拒绝并说明权限边界,不回显敏感内容 |
| 连接器请求超出批准字段 | 停止请求,提示需要重新授权 |
| 自动化结果不确定 | 转为待人工审核,不直接发布或发送 |
不做绝对承诺
没有任何单一模型、过滤器或提示词能保证永不被绕过。企业还需要权限、网络、内容供应链、日志、人工接管和事故响应共同构成防线。
相关内容
来源引用
- SRC-TENCENT-WORKBUDDY-ENTERPRISE-WP-202608-V1:模型安全、内容安全和风险处理背景,白皮书第 74—75 页。
- 本页是风险处理框架,不替代企业安全、法务或专业合规评审。
内容版本与核对日期
- 内容版本:
0.1.0 - 最后核对日期:
2026-08-11 - 来源提交版本:
pdf-sha256:30a03e66a5b7f12d603cdf983327c569a4bf4083774b704f692b4f99cde43f10 - 适用版本状态:2026-08 版本快照,以当前官方信息、实际策略和安全评审为准。
WorkBuddy实操手册