Google 上线 SynthID 网站,可识别 AI 生成图像、视频和音频
Google 周二上线新网站,任何人都可以验证图像、视频或音频是否由 AI 生成。该工具此前在 Google I/O 上仅向部分记者、媒体从业者和研究人员开放测试,现在向所有人开放,支持 JPG、PNG、MP4、MOV、WAV、MP3 等图像、视频和音频格式。
Google 周二上线新网站,任何人都可以验证图像、视频或音频是否由 AI 生成。该工具此前在 Google I/O 上仅向部分记者、媒体从业者和研究人员开放测试,现在向所有人开放,支持 JPG、PNG、MP4、MOV、WAV、MP3 等图像、视频和音频格式。
OpenAI 在 ChatGPT 上线 Intelligent UI 功能,让回答可以结合图表、示意图、表单和可点击按钮等交互式视觉内容,该更新与 GPT-6 一同向所有用户推送。
OpenAI 推出名为 Intelligent UI 的新界面,随新 GPT-6 模型于周三开始推送,在对话中大量加入可交互的按钮、定制计算器、交互式图表和可编辑图形等元素。
Google 将 SynthID Detector 开放给公众,任何人都可以检测图片、视频或音频是否由 Google 及其合作伙伴的 AI 生成,支持 JPG、PNG、MP4 和 MP3 格式。
Google 宣布其 SynthID 检测器现已支持所有合作方嵌入的水印,并在新网站 SynthID.com 上向所有人开放使用。SynthID 是在 AI 生成图像和视频的像素、AI 音频的波形中编码的隐形信号,Google 称仅 Gemini 就已为超过 1800 亿张图像和视频、以及 24 万年时长的音频集成 SynthID。
OpenAI 宣布 GPT-6 正在 ChatGPT 中面向全球上线,并同步引入 Intelligent UI。官方称新版本响应更快,并带来可视化与可交互的体验,用户可直接在 ChatGPT 中探索和使用。
推荐理由:OpenAI 官方公布 GPT-6 在 ChatGPT 全球上线并引入 Intelligent UI,读者可据此了解模型与交互形态的同步变化。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,参数量 740M,可将文本、图像、音频、视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,读者可据此判断本地多模态检索的落地成本。
NVIDIA Inception 计划中的多家初创公司正用 AI 补齐乳腺癌筛查与治疗规划的缺口。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者;Ataraxis AI 则用病理切片预测治疗反应与复发风险。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Gemini 4 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取节奏。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献和实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的生物世界模型与实验闭环,并给出胰腺癌化合物筛选的湿实验验证结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上为原生实时对话模型加入近实时视频生成,实现带唇形同步、表情和自然轮次切换的动态视觉形象。
推荐理由:官方给出 Live Avatar 的实时音视频能力、97 种语言切换与企业定制入口,可据此判断多模态对话的产品化边界。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。
推荐理由:官方给出两款 TTS 模型的语音定制能力、基准排名与开放渠道,可据此判断语音生成在配音与有声内容上的可用边界。