Google Gemini 4 Carbon 内部测试编码表现据称接近 Anthropic Opus 5.5
据 Business Insider 看到的文件、截图和内部聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已在内部编码平台 Jetski 上部署数日,据称在编程任务上强于 Argon,一名员工将其与 Anthropic 最强的编码模型 Opus 5.5 相比,但仍需更多测试。
据 Business Insider 看到的文件、截图和内部聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已在内部编码平台 Jetski 上部署数日,据称在编程任务上强于 Argon,一名员工将其与 Anthropic 最强的编码模型 Opus 5.5 相比,但仍需更多测试。
TypeSafe 宣布 Series AI 融资,Sequoia 透露其上线首周 ARR 突破 1 亿美元,公司估值达 75 亿美元,此时距 Jev 发布仅三周。
哈佛大学研究人员 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程分析数据,覆盖 2021 年至 2026 年 3 月间 700 多家软件开发公司、逾 70 万名员工的 3 亿条工作事件,发现 AI 编码工具带来的效率提升被下游环节吸收。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里几乎全程靠说话为博客建成了 Newsletters 页面,所用模型为 GPT-6 Astra High。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。其做法是把 Astra、Sol 和 Luna 匹配到不同任务,并对预算进行策略性管理。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:汇总了 Haiku 5.5 的定价、第三方评测与 token 消耗数据,便于判断小模型在智能体工作流中的成本取舍。
GitHub 发布与 Microsoft Applied Sciences 联合微调的 ModernBERT 分类器,用代码上下文识别无固定格式的密钥,候选批次评估耗时低于 2 毫秒,可将可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 用九个季度数据说明密钥泄露与代码量同步增长,并给出把检测成本压到 2 毫秒内的新分类器思路。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub pull request 的分布构建,包含 219 个 pull request、覆盖 19 种语言,数据集、评测方法、LLM judge prompt 与自测 runner 均已公开。
GitHub 提出 AI 时代开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 省下的时间解决更大问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其用第二个模型对计划、代码和测试进行批判性审查,以发现首个模型遗漏的问题。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,二者可组合使用;RAG 并未死亡,它让模型基于训练数据外的文档、内部知识和代码库上下文作答,与 Agent、Skills、MCP 可共存于同一工作流。