Claude Messages API部署新机制防止蒸馏 修改历史上下文将导致思考块失效

https://www.landian.news/archives/126629.html

A 社解释称修改思考块之前的历史内容已经成为未经授权模型蒸馏的常见技术,Claude 的部分思考内容经过加密保护,但攻击者可以反复修改前置对话,让模型重新解释甚至输出相关推理,再利用大量虚假 API 账户收集数据训练其他模型。

A 社担心这种方法不仅能够转移模型能力,还可能绕过 Claude 原本针对网络攻击等高风险用途设置的安全措施,所以新机制可以降低通过反复修改提示词批量提取推理数据的可行性。

未来新机制会覆盖所有 API 账户,对重写历史消息、执行压缩或动态修改工具定义的智能体框架,开发者需要调整架构。A 社还称不修改历史内容也可以提高缓存命中率从而降低使用成本和响应延迟。
 
 
Back to Top