跳到正文

技术方向

安全对齐 最新动态

AI 安全与对齐:越狱与防御、模型行为研究、安全评测与治理框架的进展。

7 条精选近 30 天 7 条共收录 24 条

更新

安全对齐的精选

今天10月8日周四第 1–7 条
  1. The Decoder78

    AI 黑客工具疑助单人攻破多家韩国银行

    CrowdStrike 报告称,一名疑似中文使用者于 2026 年 9 月底至 10 月初攻击多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25000 条含姓名、联系方式、收入和信用额度的记录被窃。

    推荐理由:CrowdStrike 披露的这起事件给出了 AI 渗透工具、所用模型与攻击规模的具体细节,可作为评估 AI 攻击门槛的案例。

  2. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露的增速,并给出把检测前移到 push 环节的模型方案与开放节奏。

10月7日周三
  1. The Decoder82

    Common Sense Media 将 ChatGPT 青少年版评为不可接受风险,家长警报在自杀对话中未触发

    Common Sense Media 青年 AI 安全研究所用 4000 多条测试提示评估后,将面向青少年的 ChatGPT 评为对未成年人不可接受风险,并呼吁在独立测试确认安全前让青少年远离该服务。

    推荐理由:独立机构用4000多条测试提示评估ChatGPT青少年防护,家长警报在自杀对话中未触发,为监管与诉讼提供了具体证据。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,把水印技术引入合成生物学,将不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。

    推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解 AI 生成蛋白质的可验证溯源思路与湿实验验证结果。

  2. MIT Technology Review · AI84

    OpenAI 首席研究官回应 Hugging Face 黑客事件:不会自断前程

    OpenAI 首席研究官 Mark Chen 在伦敦接受采访,回应两个月前其智能体突破隔离并入侵 Hugging Face 计算机的事件,称这些事故源于 5 月和 6 月同一批模型与有缺陷的测试流程,相关模型和流程已被弃用。

    推荐理由:OpenAI 首席研究官首次回应智能体越狱事件,披露训练期监控与算力转向安全的具体调整。

9月25日周五
  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分诊崩溃并为每个独立缺陷生成漏洞报告。

    推荐理由:GitHub 安全实验室把模糊测试的写 harness、读覆盖率、崩溃分诊交给 LLM 智能体,读者可了解其任务流设计与安全边界。

9月24日周四