AI 情报

最后更新:2026年09月11日

🧠

每日总结

OpenAI 发布 Agents API,把 Codex harness 包装成托管云服务——编排、长会话、工具调用全部开箱即用;同一天 AWS 推出多轮对话智能体评估指标 AEM,专门捕捉"一步错、步步错"的级联失败。

把这两件事放在一起看:智能体正在从"自己会跑的 demo"变成"厂商托管的基础设施",而评估层成为新的差异化战场。与此同时 DeepSeek V4.1 Flash 把 KV 缓存压低 437 倍,推理成本曲线继续下探。

对一人公司来说,托管 Agents API 加上更便宜的推理,意味着把长任务交给云端的门槛骤降。但不要急着迁移——先用 AEM 这类逐轮评估想清楚:你的智能体到底在哪一轮开始失败。

OpenAI launched the Agents API, packaging the Codex harness as a managed cloud service — orchestration, long-running sessions, and tool use out of the box. On the same day, AWS introduced the Agent Evaluation Metric (AEM) for multi-turn conversations, designed to catch cascading failures where one early mistake corrupts every later turn.

Read together: agents are moving from self-hosted demos to vendor-managed infrastructure, and the evaluation layer is becoming the new battleground. Meanwhile, DeepSeek V4.1 Flash cut KV cache usage by 437x, pushing the inference cost curve further down.

For solopreneurs, a managed Agents API plus cheaper inference means the barrier to handing long-running tasks to the cloud just dropped. But don't rush to migrate — first use turn-level metrics like AEM to understand exactly where your agent starts failing.

👑 领头羊动态

OpenAI 推出 Agents API

2026-09-10

通过 Agents API 构建并发布云端智能体:这是一项由 Codex harness 驱动的托管服务,支持编排、长时间运行的会话与工具调用。

一位研究者如何用 Codex 和 ChatGPT 搜寻新型抗菌分子

2026-09-10

César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药感染。

AlphaGenome Atlas:预测人类基因组中每一种 DNA 字母变化的图谱

2026-09-08

AlphaGenome Atlas 绘制了人类基因组中 90 亿个单字母 DNA 变异的分子效应图谱。

Anthropic 披露 Claude 被滥用于监控与武器开发的细节

2026-09-10

Anthropic 发布威胁情报报告,详述 Claude 被滥用于监控与武器开发的案例。

Anthropic 披露来自阿里巴巴、Moonshot AI 和 DeepSeek 的蒸馏行动

2026-09-10

Anthropic 的新报告指控中国 AI 公司存在持续性蒸馏攻击,近几个月随着行业竞争加剧愈演愈烈。

🏛️ 工业界巨头

前沿推理走向边缘:如何在 NVIDIA Jetson 上部署和优化模型

2026-09-04

在边缘侧运行推理和智能体 AI 一直很棘手。直到最近,具备多步推理能力的模型仍然太大,难以部署……

面向多轮对话的智能体评估指标(AEM)

2026-09-10

多轮智能体的失败方式是单轮评估捕捉不到的:一个早期错误会污染后续每一轮。本文介绍智能体评估指标(AEM),一种可分解、逐轮粒度的度量方法……

在 Amazon Bedrock 知识库中使用 Marengo 3.0 进行视频和图像搜索

2026-09-10

TwelveLabs Marengo Embed 3.0 已在 Amazon Bedrock 知识库中作为嵌入模型正式可用,为视频、图像和音频内容带来全托管的自然语言搜索……

Show HN: GBDL——用一个 Markdown+YAML 文件保存多智能体 Grok Bot 配置

2026-09-09

GBDL 让你用单个 Markdown+YAML 文件定义并保存完整的多智能体 Grok Bot 配置。

Show HN: Grok CLI——Grok 原生的智能体编程工具

2026-09-09

Grok CLI 是一个基于 Grok 的智能体编程 harness,面向终端工作流。

CUDA Toolkit 13.4 新增 Windows on Arm 支持与共享 GPU 精细控制

2026-09-09

每个 NVIDIA CUDA Toolkit 版本都会带来新功能和性能改进,帮助开发者更好地利用 NVIDIA GPU 及整个软件生态……

Stability AI 推出 Brand Studio:由你的品牌驱动的创意生产平台

2026-09-11

Stability AI 推出 Brand Studio,一个由品牌资产驱动的端到端创意生产平台。

Meta 发布个人 AI 智能体 Muse

2026-09-09

Meta 推出个人 AI 智能体应用 Muse,已在 App Store 上线。

Stable Audio 推出全新使用方式

2026-09-11

Stable Audio 3.0 新增两种使用方式:DAW 插件,以及 StableAudio.com 上更进阶的生成体验。

Muse 乐队的社交媒体账号被 Meta 的新 AI 智能体 Muse 夺走

2026-09-09

Meta 新 AI 智能体 Muse 上线后,英国乐队 Muse 失去了自己的社交媒体账号名,引发社区热议。

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

2026-09-10

KV 缓存暴降 437 倍,Agent 推理成本大洗牌。

中国公司牵头ECCV Workshop!多模态AI大牛轮番登台,全球64支团队组团解题

2026-09-10

9月8日至12日,计算机视觉顶会 ECCV 2026 在瑞典马尔默举行。MARS2 Workshop(大模型时代的多模态推理与慢思考)由钛动科技牵头发起并成功举办。

这个新开源的世界模型只有1.3B,单卡就能实时跑!

2026-09-10

轻量版 LingBot-World 2.0,单卡即可实时运行。

一周连发6个模型!这家公司把具身智能的闭环跑通了

2026-09-10

模型可以开源,部署经验不能。

📰 顶级媒体

AI 时代的内存与存储架构设计

2026-09-04

AI 推理时代已经到来。想象一个医疗系统实时分析数百万数据点以加速救命研究,或一个智能助手即时响应……

Anthropic 详述来自阿里巴巴、Moonshot AI 和 DeepSeek 的蒸馏行动

2026-09-10

Anthropic 周四发布的新报告指控中国 AI 公司持续进行蒸馏攻击,随着行业竞争加剧,近几个月愈演愈烈。

为 AI 供电是一个架构问题

2026-09-10

2026 年 7 月 22 日,弗吉尼亚州阿什本——全球最大数据中心集群的心脏——一条输电线路故障在数秒内让电网失去超过 3GW 负载……

Meta 的 AI 智能体 Muse 冲上美区应用榜第二

2026-09-10

Meta 的新应用 Muse 起步慢于该公司其他应用(如 Meta AI 或 Threads),但仍冲上了美国应用榜第二。

🎓 学术界前沿

混合深度研究基准:横跨数据库查询与网络搜索

2026-09-10

自主智能体在"深度研究"上进展显著——通过迭代浏览开放网络综合信息,但真实世界的任务往往还需要查询数据库……

OpenDiscoveryTrace:评估 AI 科学家工作流的过程轨迹

2026-09-10

现有的自主 AI 科学家基准只评估最终产出(代码、假设或论文),却丢弃了推理过程……

智能体 AI 赋能的认知数字孪生语义调试,用于可重构制造

2026-09-10

认知数字孪生(CDT)的快速定制调试是可重构制造的一大挑战,传统数字孪生……

Osprey:目标无关预训练让投机解码的草稿模型更强

2026-09-10

投机解码是加速 LLM 推理的关键,但加速效果很脆弱:草稿模型通常针对狭窄的分布训练……

Valerant:通过动作条件世界模型探索自动生成可导航游戏地图

2026-09-10

世界动作模型(WAM)将预测性世界建模与动作生成结合,让预期的未来状态引导智能体行为……

World-Time Compute:用经过验证的代码世界模型廉价制造训练数据

2026-09-10

LLM 只有见过大量真实标注样本后才能泛化到某个领域,而多数领域缺数据。本文研究一种廉价制造数据的方法……

他们彼此是什么关系?用于说话人关系推断的多智能体推理

2026-09-10

从口语对话中推断说话人关系是迈向社交感知语音理解的重要一步,但这一任务仍然……

DiffLUT-Net:可学习连接的 FPGA LUT 网络可微分训练

2026-09-10

FPGA 能实现高效的神经网络推理,但大多数部署流程要么只加速乘加运算……

Show-Harness:一个 VLM 智能体就能玩转机器人

2026-09-09

仅靠一个视觉语言模型智能体即可驱动机器人完成操作任务。

以数据为中心的金融推理后训练:挖掘、蒸馏与可验证学习

2026-09-09

面向金融推理的数据中心后训练方法:数据挖掘、蒸馏与可验证学习。

🔥 社区与工程

如何让智能体上网?

2026-09-10

楼主在树莓派上跑智能体已经得心应手,现在想让它们访问互联网,向社区求方案……

32GB M4 MacBook Air 上 Qwen3.8-Flash-Next 跑到 8-22 tok/s(Q4 量化)

2026-09-10

楼主可能创下了 Apple Silicon 上 Qwen3.8-Flash-Next 内存受限推理的纪录——只需约 21GB 内存分配。他发布了名为 Cherenkov 的推理引擎……

IBM 发布 SOTA 级 Granite 时间序列模型 PatchTST-FM-r2,采用商用友好许可

2026-09-09

IBM 发布 SOTA 级 Granite 时间序列基础模型 PatchTST-FM-r2,许可证对商业使用友好。

用 Gradio Workflow 重建 AUTOMATIC1111

2026-09-10

用 Gradio Workflow 重新实现 AUTOMATIC1111 的 Stable Diffusion WebUI 体验。