AI行业周报(8月3日-8月9日)

本周概览

  • OpenAI全面开放免费用户体验:GPT-5.6 Luna向免费用户开放不限次数文字聊天,并新增”思考”按钮支持复杂推理,标志着大模型C端普及进入新阶段。
  • 阿里发布2.4万亿参数旗舰模型Qwen3.8-Max:自主编程连续运行16天、复现论文、参加算法竞赛,在OSWorld-Verified等基准中位居参评模型首位,计划下周开源权重。
  • 谷歌DeepMind迎重大人事变动:Demis Hassabis卸任CEO转任主席,Jeff Dean等四位核心科学家离职创办Discovery Loop,被外界视为大模型进入”车库时代”的信号。
  • Anthropic推进Claude Code自动模式:8月14日起Auto Mode将成为Pro/Max/Team用户默认设置,测试显示其危险命令拦截率(89%)远超人工审核(13.6%)。
  • 国产模型竞争白热化:DeepSeek宣布API涨价、V4-Flash正式版上线;字节豆包企业版内测、Seed团队发布SeedRealtime;MiniMax H3开源登顶Hugging Face热度榜。

前沿产品发布

OpenAI

GPT-5.6系列全面扩展免费用户权限

8月6日,OpenAI宣布ChatGPT免费用户的默认模型升级为GPT-5.6 Luna,并开放不限次数的文字聊天功能。即便是轻量版模型,Luna的表现也优于此前的GPT-5.5 Instant。同时,免费用户和Go套餐订阅者新增”思考”(Think)按钮,可调用更高推理能力完成复杂任务。

Plus和Pro用户使用的GPT-5.6 Sol也迎来优化,官方称新版本进一步提升了事实准确性,并会根据问题复杂程度自动调整内容详略。ChatGPT还新增”思考深度”滑动条,允许用户自由调节模型在生成回复时投入的思考量。

GPT-Live实现连续语音交互

8月3日,OpenAI发布GPT-Live,采用无轮次语音模型和低延迟架构,实现与AI的连续语音交互。该功能让对话更快速、更自然,用户可随时打断,模型能同时倾听和回应。

Atlas浏览器服务退役

OpenAI宣布Atlas浏览器将于8月9日停止服务,其浏览器代理能力将整合进ChatGPT桌面应用和Codex中。官方表示正在构建更强大的浏览器体验,包括多标签页、下载、改进导航和账户登录支持。

阿里通义千问

Qwen3.8-Max正式发布

8月3日,阿里巴巴发布旗舰大模型Qwen3.8-Max,总参数量达2.4万亿,采用MoE稀疏激活架构,每次推理激活约950亿参数。这是千问系列迄今规模最大的模型,也是首个计划开放权重的Max级模型。

该模型主打五大方向:编程、办公、科研、长程任务和多模态智能体。官方展示的最震撼案例是:Qwen3.8-Max被要求从零创建项目并搭建自进化Agent开发系统,在无人持续介入的情况下运行约16天,累计留下265次代码提交、127个PR和151个Issue。它还能独立复现并改进研究论文、参加真实算法竞赛、在超过2000轮交互中经营虚拟电商企业。

在权威评测榜单Arena中,Qwen3.8-Max位列Text Arena实验室榜第二、Vision Arena第二。在OSWorld-Verified(电脑操作能力)基准中以86.1分位居参评模型首位。API已上线千问AI平台,国内定价为每百万Tokens输入12元、输出36元,模型权重计划下周登陆Hugging Face和ModelScope。

Qwen-Image 3.0图像生成模型上线

8月4日,阿里悄然上线Qwen-Image 3.0,在图像生成领域掀起”价格革命”。该模型输出价格仅0.18元/张,相比竞品便宜30%-70%,同时支持10px小字清晰可辨、12国语言、20+种字体样式,信息图和界面可直接使用。

字节跳动

豆包企业版内测与Seed团队新品

8月5日,豆包企业版开启内测,原生集成飞书生态。8月7日,字节Seed团队发布SeedRealtime全双工音视频模型和Seedance 2.5视频生成模型。据年中全员会透露,豆包Token日消耗量达180万亿,火山引擎MaaS今年目标收入150亿元。

字节CEO梁汝波在全员会上坦诚承认通用大模型与海外的差距仍在拉大,但明确表示长期自研、拒绝蒸馏、不抄近路。飞书ARR已做到30亿元,豆包办公定位成”AI数字同事”。

DeepSeek

API涨价与V4-Flash正式版上线

8月6日,DeepSeek发布公告计划近期整体上调API服务定价,预计涨幅较大。业内人士分析称,此次涨价意味着DeepSeek即将上线V4-Pro正式版。7月31日,DeepSeek-V4-Flash正式版API已上线公测,Agent能力大幅增强,基准测试远超Preview版本。

目前DeepSeek API执行峰谷定价机制,平时V4-Flash输入1元/百万Token、输出2元/百万Token;V4-Pro输入3元/百万Token、输出6元/百万Token。

MiniMax

H3多模态生成模型开源登顶

8月5日,MiniMax正式开源新一代通用多模态生成模型MiniMax H3,在Artificial Analysis视频编辑评测榜、Arena图生视频排行榜中均位列全球第一。该模型获得Stable Diffusion创始人Emad Mostaque、硅谷a16z合伙人Justine Moore等业内知名人士点赞,在Hugging Face上热度已上升至第一名,超过DeepSeek V4 Flash。

模型与技术突破

Meta发布Llama3.370B

8月9日,Meta发布Llama3.370B,该模型在MMLU等基准测试中 outperform Google Gemini1.5Pro、OpenAI GPT-4和Amazon Nova Pro。Meta表示新模型不仅提升了性能,还大幅降低了运营成本。目前Llama系列下载量已突破6.5亿次。

为支撑下一代模型训练,Meta宣布投资100亿美元在路易斯安那建设AI数据中心,并已在Q2将资本支出提升33%至85亿美元,同时部署超过10万块Nvidia GPU集群。值得注意的是,Meta也是唯一拒绝签署欧盟AI行为准则的一级GPAI提供商,其Llama 4社区许可协议明确排除欧盟用户。

Anthropic Claude Code Auto Mode

Anthropic宣布从8月14日起,Auto Mode将成为Claude Code Pro、Max和Team用户的默认设置。Auto Mode通过分类器自动判断工具调用是否可执行,取代此前的人工逐条审批模式。

在一项涉及1053名付费专业测试者的对照研究中,人工审核仅拦截了13.6%的危险命令,而Auto Mode拦截了89%。在真实生产环境中,严重有害行为(7级以上)在人工审批会话中占6.3%,而在Auto Mode会话中仅为2.4%。不过Anthropic也坦诚,分类器在52个真实案例中漏过了17%的越权行为。

采用Auto Mode的团队产出提升约25%,Adobe、Nuro、Gusto等企业已将其作为生产默认配置。Anthropic还从8月7日起不再向用户收取Auto Mode分类器的额外Token费用。

Kimi K3开源

7月16日,月之暗面发布Kimi K3,参数量达2.8万亿,成为全球参数规模最大的开源模型。发布48小时后,用户请求量逼近集群承载极限。K3已全面开源,开发者可自由下载部署。

学术研究与论文

AI机器科学家真实世界压力测试

中国科学技术大学团队发表最新研究,搭建包含45个模块化自动工作站的机器催化实验室,对6种智能体框架和9种大语言模型构成的48种配置进行系统评测。测试覆盖32项研究任务,共计4608次评测。

结果显示:仅151个工作流(3.3%)无需人工修复即可执行。表现最好的Claude Code + Claude Opus 4.7组合可执行率为28.1%;Codex + GPT 5.5组合为19.8%。研究进一步发现,智能体虽能根据实验结果调整参数,但始终停留在局部优化层面,未能进行科学层面的重新规划。该研究为”AI能否接管科学研究”提供了可量化的物理世界证据。

工具调用的”苦涩教训”

一篇题为《The Bitter Lesson of Tool Calling》的论文系统评估了将工具调用以代码形式(脚本链式/并行化)进行相比传统JSON调用的优势与局限。研究指出,以代码形式进行工具调用在灵活性和表达能力上显著优于刚性JSON模式,为新一代Agent编程范式提供了重要启示。

选择性上下文偏好优化

论文《Learning When to Trust via Selective Context Preference Optimization》提出选择性上下文偏好优化方法,让模型既能利用有益的外部信号,又能在面对误导性上下文时保持稳健。该方法直接回应了当前Agent与RAG场景下对信息可靠性的广泛关切。

AV-AIVAT:智能体评估成本降低74倍

《AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games》提出迭代AIVAT估计器,在不完全信息博弈中使智能体强弱评估成本降低74倍,同时保证随时有效停止。这反映出行业对Agent可测性与可控性的日益重视。

行业分析与观点

谷歌DeepMind高层地震:大模型进入”车库时代”?

8月5日,谷歌宣布DeepMind迎来重大人事调整:Demis Hassabis卸任CEO转任主席兼Alphabet首席科学家;Jeff Dean、Sanjay Ghemawat、Oriol Vinyals和Quoc Le四位核心科学家正式离开,共同创办新公司Discovery Loop。

Jeff Dean是谷歌第30号员工,在公司工作27年;Sanjay Ghemawat是MapReduce和BigTable的核心作者;Oriol Vinyals和Quoc Le则是Transformer时代的重要研究者。四位顶级科学家集体出走创业,被业内解读为大模型研究正在从”大厂集中式”向”分布式创业”转移——类似于早期PC时代的”车库创新”。

AI投资逻辑从”普涨”进入”分化期”

2026年下半年的AI投资已与2023-2024年的”普涨炒作期”发生本质变化。有分析指出,光模块、服务器、算力芯片、AI应用等细分领域已出现真实营收和利润增长,”有业绩的AI才是真主线”。

当前呈现三大分化特征:一是技术路线分化——字节明确拒绝蒸馏坚持底层自研,Meta低价入局编程智能体,DeepSeek选择涨价走高端路线;二是市场格局分化——OpenAI巩固C端优势,Anthropic深耕企业开发工具,国产模型在性价比和中文场景中寻找差异化;三是投资标的分化——从”买AI概念”转向”看业绩兑现”。

欧盟AI法案正式生效,Meta成唯一”拒签者”

8月2日,欧盟AI法案的执法机制正式启动。超过180家组织签署了GPAI行为准则,包括Anthropic、Google、Microsoft、OpenAI、Amazon等,但Meta是唯一拒绝签署的一级GPAI提供商。这意味着部署Llama模型的企业需自行承担合规风险,一旦Meta面临欧盟市场限制,相关应用将失去底层基础设施。

下周关注

  1. Qwen3.8-Max权重开源:阿里计划下周在Hugging Face和ModelScope开源Qwen3.8-Max和Qwen3.8-27B,这将是全球第二个参数规模突破2T的开源模型,开发者将能检验其真实部署成本和长程Agent运行稳定性。

  2. DeepSeek V4-Pro正式发布:伴随API涨价公告,DeepSeek V4-Pro正式版预计即将上线,其完整版性能与定价策略将对国产大模型竞争格局产生重要影响。

  3. Claude Code Auto Mode默认生效:8月14日起Auto Mode将覆盖Pro/Max/Team用户,其实际安全表现和用户接受度值得持续关注,同时也可能引发AI编程助手行业的新一轮自动化竞赛。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注