阿里正式推出Qwen3.8-Max大模型,参数规模达2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研及长周期任务处理能力。该模型不仅可回答问题,还能调用工具、修改代码并端到端完成复杂任务。开发者可通过千问AI平台获取API服务,每百万Token输入价格为12元,输出价格为36元,定价处于国产头部模型中间水平。阿里同步计划开源Qwen3.8系列27B小尺寸模型,为本地部署和低成本应用提供更多选择。
在基准测试中,Qwen3.8-Max与Anthropic旗舰模型Fable 5展开对比。结果显示,该模型在科研编程和Agent任务领域取得显著进步,例如PaperBench测试中得分从64.8分提升至93分,Agents’ Last Exam任务通过率从11.8%升至27%。但在真实软件工程测试中,Qwen3.8-Max仍存在差距,SWE-bench Pro测试得分为67.7分,低于Fable 5的80分和Claude Opus 4.8的69.2分。这表明模型在复杂代码仓库的全局理解和修改稳定性方面仍需提升。
第三方榜单Arena的数据显示,Qwen3.8-Max在视觉和文本榜单分别排名第二和第五,与榜首相差13分;前端代码榜单排名第四,落后榜首Opus 5-Max 37分。这种差异反映出模型在解题工程能力与生成结果视觉效果、用户偏好之间的平衡问题。长周期任务能力成为该模型亮点,官方案例显示其可连续运行16天完成开源项目构建,通过任务单管理、自动测试和错误恢复机制实现持续迭代。不过,行业专家指出,长周期能力需进一步验证模型在目标一致性、错误发现和恢复效率方面的表现。
开发者实测反馈显示,Qwen3.8-Max在任务拆解、Agent调用和需求理解方面较前代明显提升,但在复杂代码生成和交互功能实现上仍存在不足。独立开发者李默测试后认为,模型已触及第一梯队门槛,但在生成交互网站时出现HTML标签显示错误和核心功能缺失问题,需要更具体的指令才能精准执行。这种"交付意识"的欠缺,成为制约模型商业落地的关键因素。
与国内同期发布的Kimi K3和DeepSeek V4 Flash对比,Qwen3.8-Max在工作流智能体任务上表现优于Kimi K3,但在深度软件工程任务中落后;面对轻量化模型DeepSeek V4 Flash时,Qwen3.8-Max在编程、自动化等项目保持优势,但价格差距远大于能力差距。这种定位差异凸显出中间价位模型的挑战:既要证明能力上限优势,又需控制综合使用成本。
阿里云在模型生态构建方面展现独特优势。其模型矩阵覆盖语言、视觉、语音、视频生成等多个领域,企业客户可在统一平台组合使用不同模型。产品层面,钉钉、淘宝等业务场景与模型深度整合,发布当日同步开启公测的"千问办公"产品,直接将模型能力嵌入办公流程。数据显示,Qwen在国内企业级大模型调用市场和AI云市场均位居首位,这种生态壁垒为模型商业化提供重要支撑。
面对激烈竞争,阿里采用差异化策略:既不参与价格战,也未过度依赖单一模型优势。行业分析认为,其核心竞争力在于将模型能力转化为可部署的服务方案,通过算力、数据存储、安全合规等配套服务降低企业迁移成本。不过,生态优势的持续性取决于模型迭代速度,若Qwen系列长期落后于头部模型,用户仍可能转向其他供应商。
