AI 日报|旗舰模型密集发布,Agent 与推理芯片竞速

2266 字
11 分钟
AI 日报|旗舰模型密集发布,Agent 与推理芯片竞速

今天的 AI 行业呈现出模型、Agent 与芯片三线并进的格局。Anthropic、OpenAI、Google、DeepSeek 和字节跳动密集推出或预览新一代产品,模型能力继续向自主执行、界面操作和科研工作流延伸。

与此同时,前沿模型仍受出口管制和政府准入机制影响,算力竞争也从通用 GPU 扩展到自研推理芯片与国产训练集群。企业端则开始正视快速上涨的 AI 成本,模型选择从单纯追求最强能力转向效果与价格的平衡。

今日速览#

  • Anthropic 双线推进: 美国解除 Fable、Mythos 出口管制,Claude Sonnet 5 与 Claude Science 同步发布。
  • OpenAI 扩展模型与基础设施: GPT-5.6 Sol、Terra、Luna 进入有限预览,Jalapeño 推理芯片和 GeneBench-Pro 基准亮相。
  • Google 强化多模态 Agent: Nano Banana 2 Lite、Gemini Omni Flash 发布,Gemini 3.5 Flash 原生集成 Computer Use。
  • 中国模型密集更新: DeepSeek-V4 预览版、Seed2.1、LongCat-2.0 与 Qwen-AgentWorld 覆盖推理、Agent、世界模型和国产芯片训练。
  • 推理芯片竞争升温: OpenAI 推进自研芯片,Etched 获得 10 亿美元合同订单并达到 50 亿美元估值。
  • 企业重算 AI 经济账: 高额 Token 成本迫使企业限用昂贵模型,并转向更便宜的开源方案。

前沿模型与治理#

美国解除 Anthropic Fable、Mythos 出口管制#

美国商务部于 6 月 30 日解除对 Anthropic Fable 和 Mythos 系列模型的出口管制,距离 6 月 12 日以国家安全风险为由暂停访问不足三周。Anthropic 此前紧急禁用了 Mythos 5 和 Fable 5;Mythos 5 已于 6 月 26 日部分恢复向受信美国机构开放。

商务部长 Howard Lutnick 确认管制全面撤销。材料称,Anthropic 承诺主动检测和处理安全风险,并与美国政府合作制定未来模型发布协议。OpenAI CEO Sam Altman 批评政府筛选客户的做法;OpenAI 也因政府要求延迟了 GPT-5.6 的公开上线。

阅读 Reuters 原文

Claude Sonnet 5 强化自主 Agent 能力#

Anthropic 发布 Claude Sonnet 5,并称其为自主性最强的 Sonnet 模型。材料显示,它的性能接近 Opus 4.8但价格更低,在推理、工具使用、编码、BrowseComp 和 OSWorld-Verified 等方面均有提升,幻觉率和谄媚率也较 Sonnet 4.6 降低,网络安全防护默认开启。

推介期至 8 月 31 日,输入和输出价格分别为每百万 Token 2 美元和 10 美元,标准价格为 3 美元和 15 美元。该模型默认应用于 Free 和 Pro 计划,API 名称为 claude-sonnet-5

阅读 Anthropic 原文

GPT-5.6 Sol、Terra 与 Luna 进入预览#

OpenAI 预览 GPT-5.6 系列,包括旗舰模型 Sol、均衡模型 Terra 和低成本模型 Luna。Sol 引入 max 推理模式和 ultra 子代理模式,并在 Terminal-Bench 2.1、GeneBench v1 和 ExploitBench 上取得材料所称的领先成绩;Terra 的性能接近 GPT-5.5,但成本减半。

每百万 Token 输入和输出价格分别为:Sol 5/30 美元、Terra 2.5/15 美元、Luna 1/6 美元。该系列应美国政府要求先进行有限预览,计划未来几周扩大开放;材料还称 Cerebras 将于 7 月上线每秒 750 Token 的 Sol。

阅读 OpenAI 原文

DeepSeek-V4 预览版提升推理与 Agent#

DeepSeek-V4 预览版已在网页端、App 和 API 上线。材料称,该模型采用 MoE 架构,在 AgentWorldBench 的 MCP 工具调用、终端命令执行、搜索导航等七类智能体任务中表现领先,同时保持推理成本可控。

官方尚未披露具体参数量和正式版发布时间表;摘要同时提到量子位关于正式版可能大幅涨价的消息。

阅读 DeepSeek 官方原文

字节跳动发布 Seed2.1#

字节跳动正式发布 Seed2.1,提供 Pro 和 Turbo 两个版本,面向 AI 生产力场景,并通过火山引擎 Ark 平台提供 API 服务,同时公布配套基准测试数据。

阅读 ByteDance Seed 原文

多模态与 Agent 基础设施#

Google 推出 Nano Banana 2 Lite 与 Gemini Omni Flash#

Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)。前者面向高吞吐图像生成,材料称可在 4 秒内出图,定价为每千张 0.034 美元;后者支持自然语言视频生成与对话式编辑,定价为每秒视频 0.10 美元,单段上限 10 秒,并支持多模态引用。

两款模型均内置 SynthID 水印,已在 AI Studio 和 Gemini API 上线。

阅读 Google 原文

Gemini 3.5 Flash 原生集成 Computer Use#

Google DeepMind 将 Computer Use 原生集成到 Gemini 3.5 Flash。开发者可据此构建跨浏览器、桌面和移动端的自主 Agent,用于长周期企业自动化和持续软件测试。

该能力加入敏感操作确认门控与提示注入检测,并采用针对性对抗训练降低注入风险。目前已通过 Gemini API 和企业 Agent 平台上线,Browserbase 提供演示环境,GitHub 则提供开源参考实现。

阅读 Google 原文

xAI 推出 Grok Build /goal 模式#

xAI 为 Grok Build CLI 推出 /goal 自主任务执行模式。用户给出目标后,Agent 会自动规划、执行并验证任务,进一步将编码工具从交互式助手推向长期自主执行。

阅读 xAI 原文

Qwen-AgentWorld 开源语言世界模型#

Qwen-AgentWorld 被材料称为首个原生语言世界模型(LWM),采用 MoE 35B-A3B 架构,可模拟 MCP、Search、Terminal、Shell 等七类智能体环境,并以 Apache 2.0 许可证开源。

阅读 Qwen 官方博客

科研工作流与评测#

Anthropic 推出 Claude Science#

Anthropic 推出 Claude Science Beta,为科研人员提供整合文献检索、计算环境和 60 多项领域技能的 AI 工作台,目前面向付费用户开放。

阅读 Anthropic 原文

OpenAI 发布 GeneBench-Pro#

OpenAI 发布研究级计算生物学基准 GeneBench-Pro,以 129 道题测试 AI Agent 的高级判断能力。材料称 GPT-5.6 Sol 的通过率为 31.5%,部分题目已经开源。

阅读 OpenAI 原文

AI 芯片与国产算力#

OpenAI 与 Broadcom 发布 Jalapeño#

OpenAI 与 Broadcom 联合发布首款面向 LLM 推理、从零设计的 Intelligence Processor 芯片 Jalapeño。材料称,该芯片在 9 个月内完成从设计到流片,性能功耗比领先当前先进水平,工程样片已经运行 GPT-5.3-Codex-Spark 等机器学习负载。

Jalapeño 是多代计算平台的首款产品,计划于 2026 年底联合微软等合作伙伴部署到吉瓦级数据中心。OpenAI 模型也被用于加速芯片设计优化。

阅读 OpenAI 原文

Etched 估值 50 亿美元并获 10 亿美元订单#

AI 推理芯片公司 Etched 以 50 亿美元估值完成累计 8 亿美元融资,投资者包括 Peter Thiel、Geoffrey Hinton、Andrej Karpathy 和李飞飞。公司成立于 2022 年,2023 年一度接近现金流枯竭,其台积电代工芯片于 2026 年初成功流片。

Etched 提供面向前沿推理集群的芯片、定制机架与软件,已获得 10 亿美元合同订单,并与首批客户开展测试。报道同时指出,Cerebras 已经上市,OpenAI 也进入自研芯片赛道,竞争正在加剧。

阅读 TechCrunch 原文

美团用国产芯片训练 LongCat-2.0#

美团发布并开源 LongCat-2.0。材料称,该万亿参数模型使用 5 万张国产芯片训练,编码基准可匹敌 GPT-5.5 与 Claude Opus,并已进入 OpenRouter 排名前三。

阅读 Reuters 原文

企业 AI 的成本转向#

高额账单推动企业采用更便宜的模型#

路透社报道称,Uber 在四个月内耗尽全年 AI 预算后被迫限制使用。随着账单快速上升,企业开始转向更便宜的开源和国产模型;材料对比称,低价模型每百万 Token 可低至 0.18 美元,而顶级模型均价约为 4 美元。

这意味着企业模型选择正从单纯追逐最高能力,转向按任务匹配性能、成本与使用规模。

阅读 Reuters 原文

本期核心主题#

主题涉及消息关键变化
Agent 自主化5 条Sonnet 5、Gemini Computer Use、Grok /goal、Qwen-AgentWorld 与 GPT-5.6 子代理推进长期自主任务
模型发布与治理5 条Anthropic 管制解除,多家厂商密集发布旗舰、低成本和多模态模型
AI 芯片竞赛3 条Jalapeño 快速流片,Etched 获大额订单,美团以国产芯片训练万亿参数模型
科研与专业工作流2 条Claude Science 整合科研工具,GeneBench-Pro 衡量计算生物学判断能力
企业成本1 条高额 Token 支出推动企业转向更便宜的开源与国产方案

下载完整日报文稿#

下载《AI 日报深度阅读|2026-07-01》DOCX 原稿


本文根据所提供的深度摘要整理,未对原始报道进行独立核验。原始材料均未提供可纳入本文的公开评论内容。

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

AI 日报|旗舰模型密集发布,Agent 与推理芯片竞速
https://blog.duanjianan.com/posts/ai-daily/2026-07-01/
作者
DuanJianan
发布于
2026-07-01
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
DuanJianan
技术、学习、项目与生活
公告
欢迎来到 DuanJianan's Blog。
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
分类
标签
站点统计
文章
11
分类
4
标签
24
总字数
41,888
运行时长
0
最后活动
0 天前
站点信息
构建平台
Cloudflare Pages
博客版本
Firefly v6.13.3
文章许可
CC BY-NC-SA 4.0

文章目录