Amazon Bedrock、AgentCore 与 Strands 9 月更新汇总
Amazon Bedrock 9 月上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 Astra 支持最高 100 万 input tokens,Ultrafast 档推理速度最高提升 6 倍、达 300 tokens/秒。
Amazon Bedrock 9 月上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 Astra 支持最高 100 万 input tokens,Ultrafast 档推理速度最高提升 6 倍、达 300 tokens/秒。
Postman 披露其 Agent Mode 在 Amazon Bedrock 上的生产架构,用于支撑 4000 万开发者的 API 测试、文档、发现与实现工作。
NVIDIA 开发者用 GPT-6 Astra、Claude Fable 5 等前沿模型驱动 Omniverse 库,通过自然语言指令搭建仿真应用。案例包括仓库人形机器人模拟器、Market Street 自动驾驶测试环境、数字孪生传感器校验,以及 Unitree G1 人形机器人跨栏实验——100 次仿真中 64 次成功越过单个栏架。
Incarna 借助 Amazon Bedrock AgentCore payments,让智能体通过 x402 按次向 BlockRun 支付模型推理费用,将接入 x402 支付支持的工作量从数月缩短到数天,并已把端到端按次付费推理流程投入生产。
Amazon SageMaker HyperPod 多租户参考架构通过 AWS IAM Identity Center 集中认证、按团队划分 SageMaker AI 域和 Kubernetes 命名空间实现工作负载隔离,并用 HyperPod Task Governance 做公平资源分配、按命名空间分摊成本。
《Gears of War: E-Day》在 10 月 6 日全球发售后已上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能云端游玩,并支持 NVIDIA DLSS 和 NVIDIA Reflex。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是把 Astra、Sol 和 Luna 匹配到不同任务,并对预算进行策略性管理。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。
推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的可用区域、成本变化和与 Opus 5.5 的分工方式,便于判断是否接入现有工作流。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体协同设计软硬件,并推出 RTX Spark 笔记本与紧凑台式机。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 在原有预检索 ACL 过滤之上新增实时 ACL 校验,在查询时直接向权威数据源核实权限,避免依赖可能过期或映射错误的 ACL 数据。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测成本压到 2 毫秒内的新分类器思路。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量级智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重写智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计与 3500 行代码实现,可据此评估自建智能体训练链路。
AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架强调节省的工时并不等于利润,需有明确的变现机制和责任人;文中以年处理 20 万件理赔的分诊流程为例,说明仅按人力节省计算会高估收益。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,为全球超 4 万名客户提供带来源引用的自然语言问答,2026 年 2 月正式可用后其 Discovery Agent 已为客户发现超 10 万条洞察。
NVIDIA《State of AI in Telecommunications》报告显示,89% 受访者认为开源模型与软件对公司 AI 战略重要。NVIDIA 发布 300 亿参数的 Nemotron 3 Large Telco Model(LTM),由 AdaptKey 基于开源电信数据集微调,并开放完整微调流程。
NVIDIA Inception 计划中的多家初创公司正用 AI 覆盖乳腺癌筛查、风险评估与治疗规划环节。iSono Health 的 FDA 认证 ATUSA 可穿戴 3D 超声系统约两分钟完成单侧乳房扫描,称灵敏度比手持 2D 超声高 28%;Whiterabbit.ai 的 WRDensity 已用于数十万患者,Ataraxis AI 则用病理切片预测治疗反应与复发风险。
NVIDIA 宣布本月推出 DGX Spark 64GB 版本,由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商发售,10 月 23 日上市,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,单机支持最高 1000 亿参数模型。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群实测数据,可据此判断本地跑百亿参数智能体的成本门槛。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。
推荐理由:原文给出 Ultrafast 相对标准模式最高 8 倍 token 生成速度,读者可据此判断它对编码智能体循环的实际影响。
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的区域性空间天气风险估计。
GitHub Copilot 提出用 canvas 替代聊天框作为 AI 交互界面,canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信并调用本地代码。
GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源超大 PR。其做法是把文档高度拆成确定性的代码几何与动态块几何两个独立域:代码行高提前精确算出,评论等动态块按文件、行号和侧锚定,惰性测量并只做小幅修正。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率并支持更大的模型。
推荐理由:微软研究院首次系统测量机器人本体推理与卸载推理的差异,给出任务成功率、电池续航和工具链层面的可迁移结论。
Google DeepMind 公布 Private AI Compute 架构更新,将持久化的跨设备 AI 记忆引入云端,同时保持端侧隐私标准。该方案把数据封存在加密存储中,解密密钥仅保存在用户设备上,模型需要访问时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密、保存新上下文后立即重新加密。
推荐理由:Google 公开了云端持久记忆的隐私架构细节,读者可据此理解端侧隐私标准如何延伸到云端。
Berkeley AI Research 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,让已有 CUDA 内核作为知识库适配 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可看到跨硬件迁移的具体方法与实测差距。
伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体自行合成。文中指出多智能体在 text-to-SQL 任务中仅 10-20% 子计划互异,80-90% 子查询重复,可借多查询优化与近似查询处理复用结果。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS)的并行结构由外部预设,而非模型自主决定。文章重点讨论自适应并行推理,即让模型自行判断何时分解任务、生成多少并行线程以及如何协调,并介绍了 ParaThinker、GroupThink、Hogwild! Inference 等近期方案。