• 回答数

    0

  • 浏览数

    1

  • 收藏数

    0

作者:admin 发表于 2 小时前
跳转到指定楼层
IT之家 7 月 31 日消息,华为今日官宣,开源盘古 5050 亿参数的 openPangu-2.0-Pro 模型 (模型权重、基础推理代码)及技术报告正式开源上线。

开源盘古 openPangu 是华为开源 AI 模型品牌,致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。



openPangu-2.0-Pro 是基于昇腾 NPU 训练的大规模混合专家(MoE)语言模型, 参数规模约 505B ,每 token 激活参数规模约 18B,模型支持 512k 上下文长度,训练数据总量约 34T tokens。

后训练阶段完成快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一。



openPangu-2.0-Pro 在模型架构上实现了全面的升级:



Attention 架构:沿用高效 MLA,并采用 DSA+SWA 独立分层混合架构,层配比为 1:2;

SWA 层负责局部窗口建模,DSA 层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。



拓扑架构:将传统残差连接升级为 4 支流 mHC 架构,提升表征多样性与泛化能力。



自投机模块:采用 3 头 MTP 架构,一次额外预测 3 个 token,显著提升模型的推理速度。



Muon 优化器:训练中采用 Muon 优化器,获得更快的收敛速度。

在今年 6 月的华为开发者大会 HDC 2026 主题演讲中,华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东宣布, openPangu 2.0 计划从 6 月 30 日起陆续开源 7 大组件 ,包括新增开源的预训练代码、后训练代码、训练算子。

6 月 30 日, 92B 参数的 openPangu-2.0-Flash 模型已正式开源上线 。

对于 openPangu-2.0-Pro 总参数仅 505B,余承东曾解释称, 算力大量支持了国内的其他企业需求 ,自己留的数量还是非常有限的;此外,AI 算力成本非常高,华为更聚焦时延和吞吐率的提升。

openPangu-2.0 模型相关组件已陆续上线开源平台,IT之家附开源地址:

https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Pro

[来源链接] https://www.ithome.com/0/983/966.htm
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接