跳到正文
今天10月8日周四1 条
10月7日周三
  1. Latent Space88

    OpenAI 内部模型发布 722 篇数学手稿,称解决 500 个公开数学难题中的 90 个

    OpenAI 用未公开的内部前沿模型在 GitHub 公开发布 722 篇数学手稿,归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力。

    推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解 AI 做原创数学研究的规模与算力成本。

10月6日周二
  1. OpenAI News62

    OpenAI 公布前沿模型在数学开放问题上的进展

    OpenAI 发布内部前沿模型在数学开放问题上的新结果,并在 GitHub 上公开 Lean 证明形式化与研究细节。材料仅提供摘要,未给出具体问题、模型名称或结果数据。

    推荐理由:OpenAI 公开内部前沿模型在数学开放问题上的结果与 Lean 形式化证明,可观察 AI 做数学研究的当前边界。

10月5日周一
  1. MIT Technology Review · AI22

    如何将 AI 智能体接入企业知识

    MIT Technology Review 对 300 名数据与 AI 高管的调研显示,企业平均仅约 34% 的 agentic AI 项目能进入生产环境,遗留数据系统、安全隐私顾虑以及知识与上下文缺失是主要失败点。

10月1日周四
9月24日周四
  1. Microsoft Research62

    微软研究院:把机器人推理卸载到边缘或云端可提升任务成功率与续航

    微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,能提升任务成功率、支持更大的模型并延长续航。

    推荐理由:微软研究院首次系统测量机器人本体推理与卸载推理的差距,给出任务成功率与续航的量化对比,并开放 Kubernetes 工具链。

9月21日周一
  1. Microsoft Research60

    微软研究院在 Nature 发表 RetroChimera,提升小分子合成路线预测

    微软研究院在 Nature 发表逆向合成模型 RetroChimera,它结合 Transformer 模型 R-SMILES 2 与图神经网络 NeuralLoc,用学习式重排序整合两者预测。

    推荐理由:微软研究院公开 RetroChimera 的架构与盲测结果,读者可了解逆向合成预测如何通过集成与重排序提升路线质量。

7月29日周三
  1. Berkeley AI Research62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 与 UC Berkeley Sky Lab 将演化式内核搜索框架 K-Search 扩展到 MLX,并新增结构化 CUDA-to-MLX 翻译层,让已有 CUDA 内核作为知识库适配到 Apple Silicon。

    推荐理由:原文给出 CUDA 到 MLX 的翻译层设计与两组内核实测数据,读者可据此判断跨硬件内核迁移的可行路径。

7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,基于重建的信念评分(rec-BG)将 ABBEL 与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 长度也显著低于全上下文设置。

5月8日周五
4月20日周一
  1. Berkeley AI Research33

    GRASP:面向世界模型长时程规划的梯度规划器

    Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度避免高维视觉模型中的脆弱"状态-输入"梯度,使世界模型的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维潜空间失效模式等问题。

3月13日周五
1月10日周六
  1. Berkeley AI Research29

    伯克利提出信息驱动的成像系统设计框架,可跨四类成像任务预测性能

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化测量所含信息量,无需重建算法或任务专用解码器。该框架在彩色摄影、射电天文、无透镜成像和显微镜四个领域预测了解码器性能,优化后的设计达到端到端方法水平,且内存与算力需求更低。相关成果发表于 NeurIPS 2025 论文。