跳到正文
今天10月11日周日2 条
  1. TechCrunch · AI30

    Amazon 放弃数据中心 NDA,AI 智能体想要你的信用卡

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用保密协议,此前 Microsoft 今年早些时候已采取类似举措。保密做法引发的社区反弹已导致从纽约到旧金山数百项拟议和已生效的禁令。与此同时,一批初创公司押注消费者愿意让 AI 智能体访问自己的收件箱、文件和信用卡,前提是能让网站放行。

10月10日周六
  1. The Decoder62

    a16z 第七版 AI 产品榜:仅 4.5% 美国消费者付费,前 1% 用户贡献近两成支出

    a16z 发布第七版消费级 AI 产品榜,首次通过 YipitData 面板数据追踪美国消费者信用卡上的实际 AI 支出。报告显示近半数美国消费者使用 AI,但仅 4.5% 拥有 ChatGPT、Gemini 或 Claude 的付费个人订阅,付费用户比例一年内约翻倍;支出高度集中,前 1% 用户贡献近两成总支出,月均约 900 美元,而普通付费用户月均约 25 美元。

  2. TechCrunch · AI38

    Amazon 等公司不再对数据中心交易保密,这足以建立信任吗?

    Amazon 宣布在与地方政府谈判数据中心交易时不再使用 NDA,此前 Microsoft 今年早些时候已采取类似举措。保密做法此前引发社区对 AI 基础设施的强烈反对,从纽约到旧金山已有数百项拟议和已生效的禁令。TechCrunch Equity 播客本期讨论了放弃 NDA 能否改变数据中心交易的达成方式,以及为何信任可能才是个人 AI 初创公司真正的产品。

10月9日周五
  1. NVIDIA Blog30

    NVIDIA Omniverse 如何用 GPT-6 Astra 等前沿 AI 智能体把创意变成仿真应用

    NVIDIA 开发者用 GPT-6 Astra、Claude Fable 5 等前沿模型驱动 Omniverse 库,通过自然语言指令搭建仿真应用。案例包括仓库人形机器人模拟器、Market Street 自动驾驶测试环境、数字孪生传感器校验,以及 Unitree G1 人形机器人跨栏实验——100 次仿真中 64 次成功越过单个栏架。

10月8日周四
  1. MIT Technology Review · AI20

    AVEVA 如何为自主工业 AI 构建更安全的落地路径

    AVEVA 首席技术官 Arti Garg 提出,工业 AI 正从预测分析转向基础模型、physical AI 与 agentic AI,但因其直接作用于物理系统,安全与可靠性成为部署核心。AVEVA 的责任 AI 框架强调安全、效率与人类监督,主张 AI 应增强而非取代关键决策中的人。Garg 还参与 IEEE 工作组,制定覆盖电力、能源、水资源与碳的 AI 环境影响测量标准方法。

  2. AWS Machine Learning Blog71

    AWS 上线 Claude Haiku 5.5

    AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。

    推荐理由:文章给出 Haiku 5.5 在 Bedrock 上的可用区域、成本变化和与 Opus 5.5 的分工方式,便于判断是否接入现有工作流。

  3. Microsoft Research71

    微软研究院开源 Agent Lightning v1.0:3500 行轻量级智能体 RL 框架,支持真实 harness 训练

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量级智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的 agent harness 直接参与训练,无需在训练框架内重写智能体。

    推荐理由:微软研究院开源 Agent Lightning v1.0,给出真实 harness 参与 RL 训练的设计与 3500 行代码实现,可据此评估自建智能体训练链路。

10月7日周三
  1. AWS Machine Learning Blog26

    如何为 agentic automation 构建商业论证:超越节省工时

    AWS 提出 Agentic Value Model,用于替代为 RPA 设计的传统 ROI 模型,从时间节省、异常处理、决策质量和变更韧性四个维度衡量 agentic automation 的价值。该框架强调节省的工时并不等于利润,需有明确的变现机制和责任人;文中以年处理 20 万件理赔的分诊流程为例,说明仅按人力节省计算会高估收益。

  2. Microsoft Research22

    微软研究员 Jennifer Neville 谈 AI 评测与「意外失败」:从传统 benchmark 之外看模型真实表现

    微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在超出传统 benchmark 测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。

10月5日周一
  1. MIT Technology Review · AI12

    从预测到自主决策:预测分析如何进入智能体 AI 时代

    企业 AI 的竞争焦点已从预测模型能否超越统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。深度学习与生成式 AI 驱动的智能分析支持实时训练,使 AI 持续演进,其数据来源也从规整的数值记录扩展到非结构化交互数据。Everest Group 合伙人 Vishal Gupta 认为,"分析"一词正让位于 AI。

10月2日周五
  1. GitHub Blog · AI & ML22

    AI 正在改变开发者工作方式,GitHub 给出三项值得强化的技能

    GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。

9月26日周六
9月25日周五
  1. GitHub Blog · AI & ML66

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体模糊测试流水线

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做定级并生成漏洞报告。

    推荐理由:原文给出了从入口识别到崩溃定级的完整自动化流程与运行方式,读者可据此判断 LLM 智能体能接手多少模糊测试人工环节。

9月18日周五
  1. GitHub Blog · AI & ML22

    GitHub Podcast 拆解 AI 热门观点:该不该读 AI 生成的代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,二者可组合使用;RAG 并未死亡,它让模型基于训练数据外的文档、内部知识和代码库上下文作答,与 Agent、Skills、MCP 可共存于同一工作流。

7月26日周日
  1. Berkeley AI Research32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,以应对长程交互中上下文无法无限扩展的问题。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也显著低于全上下文设置。

7月7日周二
  1. Berkeley AI Research36

    智能免费之后怎么办?面向智能体、由智能体运行、由智能体构建的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体服务、运行智能体集群、由智能体自行合成。文中指出多智能体在 text-to-SQL 任务中仅 10-20% 子计划互异,80-90% 子查询重复,可借多查询优化与近似查询处理复用结果。