MintPick
MintPick
MintPick
Google 同时发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,6 周内第三次 Flash 更新。新模型在软件工程、agentic 任务和多步推理上大幅跃升,DeepSWE v1.1 上超越多数更大的前沿模型。Sundar Pichai 称这是 3.7 Flash 的重大升级,定价不变。在 Terminal Bench 2.1 和 HLE 评估中也优于 GPT-5.6-sol 和 Opus 5。
Meta 发布 Muse Spark 1.3,在 agentic 和编码任务上显著提升。该模型在 DeepSWE 排行榜上首次进入第三位,超越 Fable 5,仅次于 GPT-5.6-sol。Zuckerberg 称这是「编码和 agentic 工作上最大的一次飞跃」。开发者反馈其定价接近 DeepSeek 水平,远低于 Fable 5.1,被称为「首个插入 Claude 和 GPT 之间的模型」。
Anthropic 宣布 Claude 现在可以在后台使用用户的计算机。在 Claude Cowork 和 Claude Code 中,用户可以给 Claude 分配桌面任务,Claude 会自动点击、打字、打开应用,就像用户自己操作一样,而用户可以同时处理其他工作。这一功能标志着 AI agent 从对话助手向真正的自主操作迈出重要一步,对生产力工具格局有深远影响。
阿里巴巴 Qwen 团队发布的 Qwen3.8-Max-0902 在 CodeArena WebDev 排行榜上以 1691 分创下新纪录,超越此前的 1669 分。该模型在多步推理、工具使用和完整应用生成方面表现突出,被评价为 Pareto 前沿上性价比最高的模型(约 $5/MToken),优于 HY4 Preview 和 Fable 5.1 Max。Arena 评价称其在 agentic 编码工作流中设立了新标杆。
腾讯混元发布 Hy4 Preview 开源模型,总参数 770B,激活参数 49B,支持超过 100 万 token 的上下文窗口。该模型在编码、规划、工具使用、文档分析、工作流自动化和长时序任务等方面均有增强。作为中国大厂的开源模型,Hy4 Preview 的参数规模和能力定位使其成为开源生态中的重要参与者,也为开发者提供了高性价比的选择。
纽约市公立学校系统宣布在 2026-27 学年全面禁止学前班至八年级使用生成式 AI,影响超过 60 万名学生。纽约市长 Zohran Mamdani 表示科技行业「试图让我们相信 AI 驱动的早期教育不仅是必然的,而且是值得追求的」。这是美国主要城市在基础教育领域对 AI 使用采取的最严格限制之一,反映了社会对 AI 进入低龄教育的深层担忧。
美国商务部长 Howard Lutnick 接受 Axios 采访时表示「我们信任 Anthropic」,并称该公司「做了我们要求的事,回到了正确的一边」。这一表态标志着一个戏剧性的反转:此前商务部曾在夏季对 Fable 和 Mythos 实施出口管制限制,五角大楼也曾将 Anthropic 列入关注名单。此次和解对 Anthropic 的商业前景和美国 AI 政策走向都有重要意义。
Perplexity 宣布开源其混合计算功能的本地推理引擎 Lily。该引擎专为 Apple Silicon 上运行 Qwen3.6-35B-A3B 模型而构建,确保本地计算不会成为 Perplexity Computer 任务的瓶颈。这是继昨天 Perplexity 推出混合计算功能后的重要跟进,将混合计算的核心组件向社区开放,推动本地 AI 推理生态发展。
阿里巴巴 Zvec 团队开源 zg 本地搜索工具,面向开发者和 AI Agent 设计。该工具支持语义搜索、BM25 关键词搜索、混合搜索和 rg 搜索,可直接与主流 Agent 框架集成。采用本地优先架构,开箱即用。这一开源项目反映了中国 AI 团队在 Agent 基础设施工具层面的持续投入。
Unsloth 团队利用 MTP(Multi-Token Prediction)技术实现了 Qwen3.8-Flash 的本地推理加速,速度提升 1.3-1.7 倍且精度无损。在 RTX PRO 6000 上使用 GGUF 格式可达 170 tokens/s。这一成果降低了本地部署前沿模型的硬件门槛,对边缘 AI 部署有实际意义。