AI行业周报(7月20日—7月26日)

本周概览

  • DeepSeek发布V4正式开源版本,总参数达1.6万亿,以MIT协议开放,在Codeforces评测中得分3206超过GPT-5.4,API定价低至每百万Token 0.28美元,进一步压低全球大模型定价体系。
  • Anthropic推出Claude Opus 5,以旗舰模型Fable 5约一半的API成本提供近旗舰级性能,并首创内置推理强度切换功能,让企业可按任务复杂度灵活控制成本。
  • OpenAI时隔五年重返开源,发布GPT-oss-120b和GPT-oss-20b两款开源模型,采用Apache 2.0协议;同时ChatGPT上线Health健康功能,支持连接Apple Health和医疗记录。
  • 阿里Qwen密集发布多模态新品:Qwen-Image-3.0支持4.5k Token超长文本输入生成结构化图像,Qwen-Audio-3.0系列实现实时语音交互与情感化TTS,Qwen3.8-Max-Preview预览版亮相WAIC。
  • 具身智能与AI Agent基础设施加速成熟:Physical IQ评测基准发布,聚焦机器人可靠性而非炫技;蚂蚁数科Agentar 2.0预置近200个岗位级数字专家模板。

前沿产品发布

OpenAI

GPT-oss-120b与GPT-oss-20b开源发布

7月17日,OpenAI发布了两款开源语言模型GPT-oss-120b和GPT-oss-20b,这是自2019年GPT-2以来公司首次重返开源赛道。两款模型均采用Apache 2.0许可协议,允许免费商用。

  • GPT-oss-120b:在推理测试中可媲美付费版o4-mini,可在单张80GB GPU上高效运行,面向企业级部署场景。
  • GPT-oss-20b:性能对标o3-mini,仅需16GB内存即可在边缘设备运行,适用于资源受限环境。

两款模型均内置”云协作机制”,允许开发者在本地模型无法处理的复杂任务时,无缝调用OpenAI更强大的闭源模型。OpenAI CEO Sam Altman此前公开承认公司在开源问题上”站在了历史错误的一边”,此次发布被视为战略转向的重要信号。

ChatGPT Health上线

7月23日,OpenAI在美国市场推出ChatGPT Health功能。18岁以上用户可安全连接支持的健康记录系统和Apple Health数据,在ChatGPT中查看实验室结果、药物、活动、睡眠等健康信息的统一仪表盘,并基于个人健康上下文提问。OpenAI强调相关医疗数据不会用于训练基础模型或广告投放。

Anthropic

Claude Opus 5发布:成本可控的”日常旗舰”

7月24日,Anthropic发布Claude Opus 5,定位为”高效日常驱动模型”。该模型以旗舰Fable 5约一半的API价格(输入每百万Token 5美元,输出25美元)提供近旗舰级性能,并在多项编码和知识基准测试中超越Fable 5。

最大亮点是内置推理强度切换(effort toggle):用户可在每次请求时选择低、中、高三种推理强度。简单任务(如摘要、起草)使用低强度以降低成本,复杂分析或编码任务使用高强度以保障质量。合作伙伴Harvey和Zapier报告称集成后Token消耗显著下降。知识更新截止时间为2026年5月,比Fable 5(2026年1月)更新鲜四个月。

阿里云 / Qwen

Qwen-Image-3.0与Qwen-Audio-3.0系列

7月21日,阿里云发布第三代图像生成基础模型Qwen-Image-3.0,支持最大4.5k Token超长文本输入,可生成包含公式、几何图形、逻辑推导的知识图解以及复杂UI界面原型,原生支持12国语言和20余款字体。

7月24日,阿里进一步推出Qwen-Audio-3.0系列,包含两个子模型:
Qwen-Audio-3.0-Realtime:毫秒级实时语音对话,支持复杂推理,可动态调节语调与情感,支持MCP和OpenAPI工具调用。
Qwen-Audio-3.0-TTS:文本转语音模型,引入喘息、笑声、愤怒等情感标签,支持16国语言和20种中文方言,Plus版输出48kHz录音室级音质。

Qwen3.8-Max-Preview预览

在7月19日上海WAIC期间,阿里云预览了Qwen3.8-Max-Preview,宣称总参数达2.4万亿,支持100万Token上下文,公司内部测试排名仅次于Claude Fable 5。目前仅通过Token Plan订阅提供,阿里云表示未来将以开放权重形式正式发布。

字节跳动 / 豆包

Doubao 2.0发布

7月20日,字节跳动正式发布Doubao 2.0,定位专为自主Agent时代设计的下一代模型。新架构强化了推理能力和多步骤任务执行能力,在复杂推理和竞赛级数学测试中表现优于前代。

7月28日(注:实际为本周初,相关信息补充),字节在Force原动力大会上进一步推出Doubao 1.6和Seedance 1.0pro视频生成系统,API输入价格降至每百万Token 0.8元(降幅66%),Seedance 1.0pro可从文本/图像生成1080P视频,5秒高清片段成本仅3.67元。


模型与技术突破

DeepSeek V4:万亿参数开源新标杆

7月20日,DeepSeek发布V4 GA正式版,包含Pro与Flash两个版本,均以MIT协议完全开源。这是国产开源大模型在参数规模与综合性能上的又一次跃升。

指标 V4-Pro V4-Flash
总参数量 1.6万亿 2840亿
激活参数量 490亿 130亿
上下文长度 100万Token 100万Token
架构 MoE(1共享+384路由专家) MoE(1共享+256路由专家)
训练数据量 33T Token 32T Token

核心突破
百万上下文工程化:在100万Token上下文下,V4-Pro单Token FLOPs仅为V3.2的27%,KV Cache压缩至10%,使超长上下文从”技术奇点”变为可承担的工程现实。
竞赛编程领先:Codeforces Rating得分3206,超过GPT-5.4。
成本创新:V4-Flash输出定价低至每百万Token 0.28美元;DeepSeek首次引入峰谷分时计费机制。
旧接口迁移:原deepseek-chat和deepseek-reasoner接口于7月24日停止服务,统一迁移至V4系列。

Meta Llama 4:MoE架构与原生多模态

Meta近期发布的Llama 4系列是其首批采用混合专家(MoE)架构的模型。以Llama 4 Maverick为例,总参数4000亿,但激活参数仅170亿,通过交替使用密集层和MoE层实现高效推理。Llama 4还调整了安全策略,对”有争议”政治和社会话题的拒绝率降低,回应更加平衡。Meta表示这标志着Llama生态系统”原生多模态AI创新”新时代的开始。


学术研究与论文

上海AI实验室:全球首个脊椎动物数字脑

上海人工智能实验室联合中国科学院脑科学与智能技术卓越创新中心、广东省智能科学与技术研究院,发布了AGI脑机理发现系统的阶段性成果——数字斑马鱼与智算脑系统。

该模型以真实斑马鱼全脑介观神经联接图谱为结构基础,构建约含10万个神经元的数字脑,并耦合高保真具身模型与流体仿真引擎,形成”视觉输入—全脑神经元响应—运动指令输出”的闭环仿真。其预测与真实神经活动的时空相关系数达0.818,行为预测准确率超过69%,成功复刻捕食、逃跑、溯流等复杂行为。

意义:这是全球首次建立具有介观图谱约束的脊椎动物数字脑,提出”生物脑—数字脑—智算脑”的脑科学智能实验新范式,为神经科学和通用人工智能研究提供了可自主仿真、可重复实验的数字研究体系。

Physical IQ:具身智能可靠性评测基准

7月22日WAIC期间,Physical IQ基准平台正式发布。该平台由上海市人工智能行业协会、深圳河套学院与中国信通院华东分院联合发起,20余所高校与企业共同参与。

与传统评测关注”逼真度”不同,Physical IQ以可靠性作为核心指标,聚焦机器人在未知环境与长周期任务中的稳定执行能力。与会专家指出,具身智能行业仍缺乏独立第三方评测体系,且从90%到99.9%部署成功率的每一数量级提升,所需资源投入大致相当。该基准的发布有助于行业从”炫技”走向”实打实干活”。


行业分析与观点

高盛:AI投资重心迈向实体产业,六年资本开支或达7.6万亿美元

高盛发布报告指出,全球AI投资重心正从纯软件/模型层向实体产业延伸,预计未来六年全球AI相关资本开支将达到7.6万亿美元。报告认为,AI基础设施建设(数据中心、算力芯片、能源配套)将进入高速增长期,而实体产业(制造业、机器人、自动驾驶)的AI渗透率提升将成为下一阶段的核心驱动力。

Anthropic估值反超OpenAI,大模型竞争进入企业场景深水区

Anthropic在7月前后完成新一轮融资,投后估值 reportedly 达到9650亿美元,超过OpenAI。与此同步,Claude Opus 5的发布和Claude Code的快速增长(年化收入超10亿美元)表明,大模型竞争正从”聊天问答谁更聪明”转向”谁能在企业场景里稳定干活、持续调用工具、管理复杂任务”。

大模型”智能比”竞争升温

7月下旬,OpenAI和Anthropic先后通过降价或推出成本可控模型,将”价格/智能比(price/intelligence tradeoff)”推向竞争前台。Sam Altman公开表示希望在”每一个模型层级都提供最好的价格与智能比”。当模型能力逐渐趋近,如何让同样算力完成更多工作、让开发者花更少钱获得更多智能,正在成为下一轮大模型竞争的重要方向。

蚂蚁数科Agentar 2.0:智能体进入规模化复制阶段

7月19日WAIC期间,蚂蚁数科发布Agentar 2.0,定位”商业智能体超级工厂”。平台首批预置近200个岗位级数字专家模板,覆盖财务、法务、运营等岗位,并提供数百个可订阅的Skills级开箱即用智能体工具。值得关注的是,蚂蚁数科主张以区块链技术为每个Agent赋予可信身份,将决策、协作与资金流转全流程记录上链,解决多智能体协作中的交易确责、数据溯源与价值确权问题。这标志着Agent落地从”能力验证”进入”治理与规模化”阶段。


下周关注

  1. OpenAI GPT-5.6价格调整后续影响:OpenAI于7月31日宣布GPT-5.6 Luna降价80%、Terra降价20%,并新增Sol Fast模式。下周需密切关注Anthropic、Google等厂商是否会跟进价格战,以及开发者社区的实际迁移情况。

  2. Google Gemini Robotics 2生态推进:Google DeepMind于7月31日发布Gemini Robotics 2和Gemini Robotics ER 2,实现人形机器人全身控制与多步骤任务推理。下周关注其与Apptronik、Boston Dynamics等合作伙伴的落地进展,以及开发者平台开放节奏。

  3. Qwen3.8与DeepSeek V4的开源生态反馈:两款国产万亿/千亿参数级模型均承诺以开放权重形式发布,下周关注Hugging Face和ModelScope社区的下载量、微调案例和企业部署反馈。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注