OpenAI 推出 Agents API
2026-09-10通过 Agents API 构建并发布云端智能体:这是一项由 Codex harness 驱动的托管服务,支持编排、长时间运行的会话与工具调用。
最后更新:2026年09月11日
OpenAI 发布 Agents API,把 Codex harness 包装成托管云服务——编排、长会话、工具调用全部开箱即用;同一天 AWS 推出多轮对话智能体评估指标 AEM,专门捕捉"一步错、步步错"的级联失败。 把这两件事放在一起看:智能体正在从"自己会跑的 demo"变成"厂商托管的基础设施",而评估层成为新的差异化战场。与此同时 DeepSeek V4.1 Flash 把 KV 缓存压低 437 倍,推理成本曲线继续下探。 对一人公司来说,托管 Agents API 加上更便宜的推理,意味着把长任务交给云端的门槛骤降。但不要急着迁移——先用 AEM 这类逐轮评估想清楚:你的智能体到底在哪一轮开始失败。
通过 Agents API 构建并发布云端智能体:这是一项由 Codex harness 驱动的托管服务,支持编排、长时间运行的会话与工具调用。
César de la Fuente 的实验室利用 Codex 和 ChatGPT,在现存与已灭绝生物的基因组中搜寻抗菌候选分子,以对抗耐药感染。
AlphaGenome Atlas 绘制了人类基因组中 90 亿个单字母 DNA 变异的分子效应图谱。
Anthropic 发布威胁情报报告,详述 Claude 被滥用于监控与武器开发的案例。
Anthropic 的新报告指控中国 AI 公司存在持续性蒸馏攻击,近几个月随着行业竞争加剧愈演愈烈。
在边缘侧运行推理和智能体 AI 一直很棘手。直到最近,具备多步推理能力的模型仍然太大,难以部署……
多轮智能体的失败方式是单轮评估捕捉不到的:一个早期错误会污染后续每一轮。本文介绍智能体评估指标(AEM),一种可分解、逐轮粒度的度量方法……
TwelveLabs Marengo Embed 3.0 已在 Amazon Bedrock 知识库中作为嵌入模型正式可用,为视频、图像和音频内容带来全托管的自然语言搜索……
GBDL 让你用单个 Markdown+YAML 文件定义并保存完整的多智能体 Grok Bot 配置。
Grok CLI 是一个基于 Grok 的智能体编程 harness,面向终端工作流。
每个 NVIDIA CUDA Toolkit 版本都会带来新功能和性能改进,帮助开发者更好地利用 NVIDIA GPU 及整个软件生态……
Stability AI 推出 Brand Studio,一个由品牌资产驱动的端到端创意生产平台。
Meta 推出个人 AI 智能体应用 Muse,已在 App Store 上线。
Stable Audio 3.0 新增两种使用方式:DAW 插件,以及 StableAudio.com 上更进阶的生成体验。
Meta 新 AI 智能体 Muse 上线后,英国乐队 Muse 失去了自己的社交媒体账号名,引发社区热议。
KV 缓存暴降 437 倍,Agent 推理成本大洗牌。
9月8日至12日,计算机视觉顶会 ECCV 2026 在瑞典马尔默举行。MARS2 Workshop(大模型时代的多模态推理与慢思考)由钛动科技牵头发起并成功举办。
轻量版 LingBot-World 2.0,单卡即可实时运行。
模型可以开源,部署经验不能。
AI 推理时代已经到来。想象一个医疗系统实时分析数百万数据点以加速救命研究,或一个智能助手即时响应……
Anthropic 周四发布的新报告指控中国 AI 公司持续进行蒸馏攻击,随着行业竞争加剧,近几个月愈演愈烈。
2026 年 7 月 22 日,弗吉尼亚州阿什本——全球最大数据中心集群的心脏——一条输电线路故障在数秒内让电网失去超过 3GW 负载……
Meta 的新应用 Muse 起步慢于该公司其他应用(如 Meta AI 或 Threads),但仍冲上了美国应用榜第二。
自主智能体在"深度研究"上进展显著——通过迭代浏览开放网络综合信息,但真实世界的任务往往还需要查询数据库……
现有的自主 AI 科学家基准只评估最终产出(代码、假设或论文),却丢弃了推理过程……
认知数字孪生(CDT)的快速定制调试是可重构制造的一大挑战,传统数字孪生……
投机解码是加速 LLM 推理的关键,但加速效果很脆弱:草稿模型通常针对狭窄的分布训练……
世界动作模型(WAM)将预测性世界建模与动作生成结合,让预期的未来状态引导智能体行为……
LLM 只有见过大量真实标注样本后才能泛化到某个领域,而多数领域缺数据。本文研究一种廉价制造数据的方法……
从口语对话中推断说话人关系是迈向社交感知语音理解的重要一步,但这一任务仍然……
FPGA 能实现高效的神经网络推理,但大多数部署流程要么只加速乘加运算……
仅靠一个视觉语言模型智能体即可驱动机器人完成操作任务。
面向金融推理的数据中心后训练方法:数据挖掘、蒸馏与可验证学习。
楼主在树莓派上跑智能体已经得心应手,现在想让它们访问互联网,向社区求方案……
楼主可能创下了 Apple Silicon 上 Qwen3.8-Flash-Next 内存受限推理的纪录——只需约 21GB 内存分配。他发布了名为 Cherenkov 的推理引擎……
IBM 发布 SOTA 级 Granite 时间序列基础模型 PatchTST-FM-r2,许可证对商业使用友好。
用 Gradio Workflow 重新实现 AUTOMATIC1111 的 Stable Diffusion WebUI 体验。