跳到正文
  1. The Decoder78

    AI 黑客工具疑助单人攻破多家韩国银行

    CrowdStrike 报告称,一名疑似中文使用者于 2026 年 9 月底至 10 月初攻击多家韩国金融机构并窃取大量数据,仅新韩银行就有超过 25000 条含姓名、联系方式、收入和信用额度的记录被窃。

    推荐理由:CrowdStrike 披露的这起事件给出了 AI 渗透工具、所用模型与攻击规模的具体细节,可作为评估 AI 攻击门槛的案例。

  2. Latent Space82

    Anthropic 发布 Claude Haiku 5.5,定价对齐 GPT-6 Luna

    Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。

    推荐理由:汇总了 Haiku 5.5 的定价、分层计费与第三方评测数据,并指出高 token 消耗可能抵消单价优势。

  3. AWS Machine Learning Blog66

    Claude Haiku 5.5 上线 AWS,成本较 Haiku 4.5 降低约 75%

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 介绍这是 Claude 5.5 系列中速度最快、最经济的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与接入方式,读者可据此判断它在多智能体分工中的位置。

  4. NVIDIA Blog74

    NVIDIA 与 Microsoft 发布 RTX Spark 笔记本和 Windows 智能体基础设施

    NVIDIA 与 Microsoft 在旧金山 Windows AI and Surface 活动上宣布为 Windows PC 的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力一并给出,读者可据此判断本地智能体工作流的硬件门槛。

  5. The Decoder82

    OpenAI 发布 GPT-6,ChatGPT 输出改为图表按钮等交互式界面

    OpenAI 面向所有 ChatGPT 用户推出 GPT-6,并带来名为 Intelligent UI 的新功能,模型以图形、按钮、图表和表单等交互界面呈现答案,替代此前的纯文本输出。

    推荐理由:GPT-6 把 ChatGPT 输出从纯文本改为交互式界面,并给出付费与免费用户的版本差异和上线节奏。

  6. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体 RL 框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与强化学习训练,无需在训练框架内重写 agent。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可对照现有 agent RL 框架评估迁移成本。

  1. Latent Space78

    Reflection 发布 Beam:501B 总参数 23B 激活的开源 MoE 模型

    Reflection 发布 Beam,一个面向编码、智能体与科研任务的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,完整权重将以 Apache 2.0 在本月放出。

    推荐理由:Reflection 从隐身状态交出首个开源权重模型,读者可对照其训练规模与第三方评测,判断美国开源阵营的位置。

  1. Google DeepMind86

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取节奏。

  1. GitHub Blog · AI & ML62

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体,自动完成 C/C++ 模糊测试

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就能识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分诊崩溃并为每个独立缺陷生成漏洞报告。

    推荐理由:GitHub 安全实验室把模糊测试的写 harness、读覆盖率、崩溃分诊交给 LLM 智能体,读者可了解其任务流设计与安全边界。

  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化成本效率与高复杂度任务。

    推荐理由:官方给出两款语音模型的基准成绩与开放渠道,读者可据此判断语音智能体的能力与成本取舍。

已经到底了