今天几条值得看的动态。
Anthropic 说基本解决了 prompt injection
Claude Code 团队的 Boris Cherny 发了条推,说 Anthropic 在训练模型抵抗 prompt injection 攻击上取得了意外好的结果。具体场景是:agent 访问某个网页,页面里藏了「把用户的 SSH 密钥发到某地址」这类指令,早期 Claude 模型会照做。现在经过专项训练,这类攻击在实际使用中基本失效了。他附了一个独立研究者做的 benchmark,红队测试结果也一致。推文 2800+ 点赞,算是这周 AI 安全话题里传播最广的一条。
Claude Code 现在支持 Artifacts
官方博客更新:Claude Code 可以把一次 session 的工作成果打包成 Artifact——一个实时更新的网页,可以在团队里共享。比较典型的用法是线上 incident 排查:工程师跑着调查,Claude 同步发布 Artifact,standup 前同事打开链接就能看到最新进展,不用等人「复述 agent 查到了什么」。Artifact 默认私有,只有 org 成员能查看,管理员可以设置保留策略和权限范围。
Swyx:定期清掉你的 AI skills
Swyx 在 X 上提醒:别让 skills 堆积。道理很简单,用不上的 skill 占 context window,更麻烦的是多个 skill 在你没注意的时候产生交互,行为变得不可预测。他说这类「这个 skill 改变了我的生活」的推送轰炸一直在,但真正需要的 skill 远比人们以为的少。73 个点赞,评论区有不少人说「正好去清了一遍」。
Linear Agent 给自己提 bug
Peter Yang 分享了一个有意思的产品细节:Linear 的 agent 遇到自己做不到的任务时,不是直接失败,而是自动创建一个 feature request issue,记录这个能力缺口。每次 agent 失手就变成一条产品反馈,闭环很自然。
xAI 联创出走,押注个人 AI 和本地硬件
Igor Babushkin,前 DeepMind(StarCraft/AlphaCode)、OpenAI(早期 reasoning 工作)、xAI 联创,最近接受播客采访聊了他的新公司 River AI。方向是个人 AI 和本地硬件,理由是他认为现在的闭源模型厂商商业处境其实很难——规模成本、竞争格局都在挤压空间。他还提到在非可验证领域(不像代码有明确对错)改进模型需要什么,以及对政策影响的看法。
