跳到正文
  1. AWS Machine Learning Blog66

    Claude Haiku 5.5 上线 AWS,成本较 Haiku 4.5 降低约 75%

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,据 Anthropic 介绍这是 Claude 5.5 系列中速度最快、最经济的模型,面向子智能体和高并发成本敏感场景,多数任务成本比 Claude Haiku 4.5 低约 75%。

    推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本降幅与接入方式,读者可据此判断它在多智能体分工中的位置。

  2. NVIDIA Blog74

    NVIDIA 与 Microsoft 发布 RTX Spark 笔记本和 Windows 智能体基础设施

    NVIDIA 与 Microsoft 在旧金山 Windows AI and Surface 活动上宣布为 Windows PC 的 AI 智能体共同设计软硬件,Microsoft 宣布 OS 级基础设施 Microsoft Execution Containers(MXC)正式可用,让智能体在系统控制下安全持久地在后台运行。

    推荐理由:NVIDIA 与 Microsoft 把智能体运行所需的系统级容器和本地算力一并给出,读者可据此判断本地智能体工作流的硬件门槛。

  3. GitHub Blog · AI & ML60

    GitHub 推出基于 ModernBERT 的通用密钥检测模型,扩展 push protection

    GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。

    推荐理由:GitHub 用九个季度数据说明密钥泄露的增速,并给出把检测前移到 push 环节的模型方案与开放节奏。

  4. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体 RL 框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与强化学习训练,无需在训练框架内重写 agent。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计取舍与实测增益,可对照现有 agent RL 框架评估迁移成本。

  1. NVIDIA Blog62

    NVIDIA DGX Spark 推出 64GB 版本,支持双机集群扩展本地 AI

    NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,单机支持最高 1000 亿参数模型。

    推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。

  2. NVIDIA Blog78

    NVIDIA GPU 如何加速 OpenAI GPT-6 Astra Ultrafast

    OpenAI 的 GPT-6 Astra Ultrafast 已在 OpenAI API 上线,并向符合条件的 ChatGPT Work 和 Codex 用户开放,运行在 NVIDIA Blackwell GPU 上。

    推荐理由:原文给出 Ultrafast 模式相对标准模式的加速倍数与开放入口,读者可据此判断它对编码智能体循环的实际影响。

  1. Microsoft Research62

    微软研究院:把机器人推理卸载到边缘或云端可提升任务成功率与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,能提升任务成功率、支持更大的模型并延长续航。

    推荐理由:微软研究院首次系统测量机器人本体推理与卸载推理的差距,给出任务成功率与续航的量化对比,并开放 Kubernetes 工具链。

  2. Google DeepMind62

    Google DeepMind 为 Private AI Compute 引入安全服务端记忆

    Google DeepMind 公布 Private AI Compute 的新技术能力,将持久化服务端记忆引入该平台,使 AI 助手能在跨设备场景下保留上下文。

    推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此理解跨设备 AI 记忆如何在密钥留在本地的前提下实现。

  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 与 UC Berkeley Sky Lab 将演化式内核搜索框架 K-Search 扩展到 MLX,并新增结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配到 Apple Silicon。

    推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,读者可据此判断跨硬件内核迁移的可行路径。

已经到底了