微软发布 Decision-1 决策模型,基于 Qwen3.5-9B
微软推出自研决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,达到 83.5%,延迟 85 ms,速度是第二名 H2O-Lightning-4B 的 2.5 倍。
微软推出自研决策模型 Decision-1,用于分类、评估和路由决策,并称其有潜力引导和控制智能体应对复杂环境。该模型基于 Qwen3.5-9B,微软称其在覆盖近 15 万个问题的 36 项基准测试中准确率最高,达到 83.5%,延迟 85 ms,速度是第二名 H2O-Lightning-4B 的 2.5 倍。
TypeSafe 宣布 Series AI 融资,Sequoia 透露其上线首周 ARR 突破 1 亿美元,公司估值达 75 亿美元,此时距 Jev 发布仅三周。
MIT Technology Review 刊文指出,AI 的拒绝能力已成为 AI 安全的核心机制,但这一机制并不可靠。Anthropic 2021 年提出大语言模型应"有用、诚实、无害",如今模型经大量拒绝训练后仍常出现失败,部分用户正试图用最先进 AI 研发生物病原体和自主无人机蜂群。文章认为,拒绝机制的边界由 AI 公司秘密划定,政府也将介入,而拒绝能力越强,越可能被用于压制异见。
Periodic Labs 联合创始人 Liam Fedus 与 Ekin Dogus Cubuk 在 Latent Space 播客中提出“合成超级智能”(synthesis superintelligence),主张 AI 科学发现不能只靠更多互联网数据训练,而要让模型在真实物理实验中学习。
微软 partner research manager Jennifer Neville 在 Microsoft Research Podcast 中讨论了评测如何推动 AI 系统性能边界,以及模型在超出传统 benchmark 测试时出现的「意外失败」。她结合自身从数学、物理、认知科学到计算机科学的经历,分享了使用当前 AI 系统的实用建议,并强调当结果偏离预期时应仔细审视数据。
GPT-6 Astra Ultrafast 已在 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户中开放,运行在 NVIDIA Blackwell GPU 上,token 生成速度最高比 Astra Standard 模式快 8 倍。
推荐理由:原文给出 Ultrafast 相对标准模式最高 8 倍 token 生成速度,读者可据此判断它对编码智能体循环的实际影响。
Berkeley AI Research 与 IBM Research 将演化式内核搜索框架 K-Search 扩展到 MLX 后端,通过结构化的 CUDA 到 MLX 翻译层,让已有 CUDA 内核作为知识库适配 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可看到跨硬件迁移的具体方法与实测差距。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,以应对长程交互中上下文无法无限扩展的问题。在协作编程基准 CollabBench 上,采用基于重构的信念评分后,ABBEL 将全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也显著低于全上下文设置。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前多数方法(如 Self-consistency、Best-of-N、Tree of Thoughts、MCTS)的并行结构由外部预设,而非模型自主决定。文章重点讨论自适应并行推理,即让模型自行判断何时分解任务、生成多少并行线程以及如何协调,并介绍了 ParaThinker、GroupThink、Hogwild! Inference 等近期方案。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代中直接注入随机性以探索、并重塑梯度让动作获得清晰信号,同时避开高维视觉模型中脆弱的"状态-输入"梯度,使基于学习动力学(世界模型)的长时程规划变得可行。该工作与 Mike Rabbat、Aditi Krishnapriyan、Yann LeCun、Amir Bar 合作完成。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征归因、数据归因和机制可解释性中大规模识别驱动模型输出的关键交互。