Amazon 放弃数据中心 NDA,AI 智能体想要你的信用卡
Amazon 宣布在与地方政府谈判数据中心交易时不再使用保密协议,此前 Microsoft 今年早些时候已采取类似举措。保密做法引发的社区反弹已导致从纽约到旧金山数百项拟议和已生效的禁令。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是能让网站放行。
Amazon 宣布在与地方政府谈判数据中心交易时不再使用保密协议,此前 Microsoft 今年早些时候已采取类似举措。保密做法引发的社区反弹已导致从纽约到旧金山数百项拟议和已生效的禁令。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是能让网站放行。
微软 CEO 纳德拉在 X 发长文谈高级 AI 模型的风险,主张应假定模型已被攻陷并从一开始就加以隔离,就像给 AI 装一个紧急刹车,授权人员应能随时暂停或关闭正在执行任务的模型。他还呼吁建立更透明的体系,让模型可被隔离、可被观察,并留下防篡改的人类可读证据,同时提出及时披露事件、独立审计和可验证数据等建议。文中他多次用超级智能一词指代 AI。
微软 CEO Satya Nadella 在 X 发帖称,应重新审视 AI 的信任架构,不能把超级智能当作嵌套黑盒来接受或拒绝其建议、答案和行动。他提出把模型与编排其工作的 harness 分离、将控制与保障措施外置,并要求每个有意义的模型动作都留下防篡改、人类可读的证据,同时让授权人员始终能在任务中途暂停或关闭模型。
微软推出自研决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,达到 83.5%,延迟 85 ms,速度是第二名 H2O-Lightning-4B 的 2.5 倍。
Amazon 宣布在与地方政府谈判数据中心交易时不再使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密做法此前引发社区对 AI 基础设施的强烈反对,从纽约到旧金山已有数百项拟议和已生效的禁令。TechCrunch Equity 播客本期讨论了放弃 NDA 能否改变数据中心交易的达成方式,以及为何信任可能才是个人 AI 初创公司真正的产品。
Amazon Bedrock 9 月上线 OpenAI 的 GPT-6 Astra、Sol、Luna 系列模型,其中 Astra 支持最高 100 万 input tokens,Ultrafast 档推理速度最高提升 6 倍、达 300 tokens/秒。
特朗普签署行政令,禁止在可能的情况下使用"AI"一词,要求将人工智能改称"超级智能"(Super Intelligence),并将继续使用"Artificial Intelligence"的人称为"敌人"。
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应"有用、诚实、无害",如今模型经大量拒绝训练后仍常出现失败,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章认为,拒绝机制的边界由 AI 公司秘密划定,政府也将介入,而拒绝能力越强,越可能被用于压制异见。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
微软在两年来的首场线下活动中发布新款 Surface Laptop Ultra,并公布 Windows 11 的一系列改动,同时展示本地 AI 与智能体工作流如何改变个人计算。
在旧金山 Microsoft 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体协同设计软硬件,并推出 RTX Spark 笔记本与紧凑台式机。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一并给出,读者可据此判断本地智能体的落地条件。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测成本压到 2 毫秒内的新分类器思路。
微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量级智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重写智能体。
推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计与 3500 行代码实现,可据此评估自建智能体训练链路。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在超出传统 benchmark 测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言,数据集、评测方法、LLM judge prompt 与自测 runner 均已公开。
微软研究院实习生开发了一套端到端机器学习流水线,结合太阳风观测、AE 与 Dst 指数预报、地质电导率和电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的区域性空间天气风险估计。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据训练的生物世界模型,以及连接模型、科学工具、文献与实验人员的交互式 harness 组成。
推荐理由:微软研究院公开 Quine 的多模态生物世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。
微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗、金融、教育等领域伙伴合作,将多模态医疗 AI 和自进化诊断智能体等研究落地,并获新加坡经济发展局支持联合培养博士生。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码。
GitHub Copilot 提出用 canvas 替代聊天框作为 AI 交互界面,canvas 是运行在 GitHub Copilot 应用内的全栈小应用,可与 agent 双向通信并调用本地代码。
GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源超大 PR。其做法是把文档高度拆成确定性的代码几何与动态块几何两个独立域:代码行高提前精确算出,评论等动态块按文件、行号和侧锚定,惰性测量并只做小幅修正。
微软研究院对移动操作机器人工作负载做了系统性测量,发现把物理 AI 推理从机器人本体 GPU 卸载到边缘或云端 GPU,可提升任务成功率并支持更大的模型。
推荐理由:微软研究院首次系统测量机器人本体推理与卸载推理的差异,给出任务成功率、电池续航和工具链层面的可迁移结论。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式重排序整合两者互补预测,在盲测中化学家更偏好其单步反应预测。
微软研究院发布 GigaPath-Flash 和 GigaTIME-Flash,用蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干替代原模型,在 PANDA 前列腺分级和 EBRAINS 脑肿瘤分型基准上以约 50 倍更少算力达到原 GigaPath 3% 以内的性能。