8月3日,阿里巴巴千问(Qwen)团队正式推出千问3.8-Max。这款模型总参数量高达2.4万亿,激活参数95B,不仅是千问家族目前体量最大、能力最强的成员,也是该系列首次将Max级别模型开源。其权重文件计划于下周在Hugging Face和ModelScope两大开源社区上线。
在定价策略上,通过阿里云千问AI平台提供的API调用服务中,输入成本为2.0美元/百万tokens,输出为6.0美元/百万tokens,隐式缓存费用则为0.25美元/百万tokens。
基准测试数据显示,千问3.8-Max在编程智能体及通用智能体等多项指标上与Anthropic Fable5旗鼓相当,部分领域甚至实现超越。具体来看,PaperBench得分93.0,优于Fable5的88.8;CoWorkBench得分74.8,与Fable5的75.9极为接近;WideSearch得分81.9,同样持平Fable5的81.2。
性能表现:对标Fable 5,局部领先
依据千问团队公布的完整基准数据,Qwen3.8-Max在多核心指标上已与Anthropic Claude Fable 5持平或胜出。
多模态处理能力同样亮眼。需要说明的是,Fable 5的部分结果可能涉及回退机制,千问团队已在注释中对此作出澄清。
编程实战:从空白文件夹到生产级交付
千问团队选取三个真实案例,检验千问3.8-Max的自主编程实力,全程无需人工干预。
案例一:十天自动开发。模型从零构建oh-my-cli项目,自主运行约16天,累计提交265次commits、127个PR及151个issues。它巧妙融合用户反馈、社区实践与自测结果,形成需求自动领取、代码生成至测试验证的完整闭环。
案例二:复现并超越论文。模型独立工作约125小时,编写代码约7,600行,执行操作超1,100步,完成33轮GPU训练,精准复现《Unified Data Selection for LLM Reasoning》论文的六项主要结论。随后进入“自我进化”阶段,提出并测试18种改进方案,最终在AIME24竞赛级数学基准上,较原方法再提升2.7分。
案例三:24小时击败87%人类队伍。在WWW2025多模态对话意图识别挑战赛中,面对526支人类队伍,模型经45次迭代提交,准确率由0.60跃升至0.853,成功击败458支队伍。
办公与长程任务:数百职业场景的生产级验证
千问团队在数百个高价值职业场景中,实测了千问3.8-Max的实际交付水准。
在E-Commerce Bench(365天电商经营模拟基准)里,千问3.8-Max以¥416,252的收益夺冠,回报倍数达4.16倍,超出第二名GLM 5.2的38%,较上一代千问3.7-Max提升152%。
芯片设计:500轮交互,面积缩减81%
千问3.8-Max在芯片设计优化任务中展现了长程自主规划能力。
任务目标是优化G CD/RSA密码硬件加速器的逻辑门数量。在无参考设计、无人工介入的情况下,模型历经约500轮交互、71次评估,跨越13个关键里程碑,将初始设计的8,298门压缩至678门,位列所有参评模型之首。
物理实现层面,芯片面积从106×106 µm²收缩至46×46 µm²,布线长度由33,369 µm降至4,187 µm,并在500 MHz频率下实现时序闭合,整体芯片面积缩减81%。
多模态能力:视觉贯穿执行全流程
千问3.8-Max的视觉能力不止于“看懂图片”,而是作为持续反馈回路融入任务执行始终。
执行过程中,模型会持续观察中间产物——检查页面布局、物体方向、动画效果——发现问题后自主定位偏差并修正。千问团队将此定义为“原生视觉反馈回路”。
基准测试方面,千问3.8-Max在OSWorld-Verified得分86.1,超过Fable5的85.0;AndroidWorld得分85.3,虽略低于Fable5的88.8但差距微小;ParametricCAD Bench得分91.5,胜过Fable5的87.5。
为方便开发者接入,千问团队同步推出千问-MM-Plugins,为不同智能体框架提供图像与视频处理、多模态记忆、视觉工具调用等扩展支持。
开放接入:兼容Claude Code、Codex等主流框架
千问3.8-Max现已通过千问AI平台提供API服务,支持OpenAI兼容协议和Anthropic兼容协议,可直接集成至Claude Code、Codex、Qoder CLI、千问 Code、OpenClaw等主流开发工具。
API支持reasoning_effort参数调节推理深度:xhigh(默认,适合复杂任务)、medium(平衡准确性与速度)、low(优化速度与成本)。
模型权重将于下周在Hugging Face和ModelScope开源,届时千问3.8-27B也将同步开源。
















