The Wayback Machine - https://web.archive.org/web/20240529072306/https://tech.gmw.cn/2024-05/29/content_37351334.htm
Image

点击右上角Image微信好友

Image朋友圈

Image

请使用浏览器分享功能进行分享

Image

Image Image Image
正在阅读:浪潮信息发布“源2.0-M32”开源大模型
首页> Image科技频道> 人工智能 > 正文

浪潮信息发布“源2.0-M32”开源大模型

来源:光明网2024-05-29 14:58

  5月28日,浪潮信息发布“源2.0-M32”开源大模型。“源2.0-M32”在基于“源2.0”系列大模型已有工作基础上,创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),并大幅提升了模型算力效率,模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型。

  在算法层面,源2.0-M32提出并采用了一种新型的算法结构:基于注意力机制的门控网络(Attention Router),针对MoE模型核心的专家调度策略,这种新的算法结构关注专家模型之间的协同性度量,有效解决传统门控网络下,选择两个或多个专家参与计算时关联性缺失的问题,使得专家之间协同处理数据的水平大为提升。源2.0-M32采用源2.0-2B为基础模型设计,沿用并融合局部过滤增强的注意力机制(LFA, Localized Filtering-based Attention),通过先学习相邻词之间的关联性,然后再计算全局关联性的方法,能够更好地学习到自然语言的局部和全局的语言特征,对于自然语言的关联语义理解更准确,进而提升了模型精度。

  在数据层面,源2.0-M32基于2万亿的token进行训练、覆盖万亿量级的代码、中英文书籍、百科、论文及合成数据。大幅扩展代码数据占比至47.5%,从6类最流行的代码扩充至619类,并通过对代码中英文注释的翻译,将中文代码数据量增大至1800亿token。结合高效的数据清洗流程,满足大模型训练“丰富性、全面性、高质量”的数据集需求。基于这些数据的整合和扩展,源2.0-M32在代码生成、代码理解、代码推理、数学求解等方面有着出色的表现。

  在算力层面,源2.0-M32采用了流水并行的方法,综合运用流水线并行+数据并行的策略,显著降低了大模型对芯片间P2P带宽的需求,为硬件差异较大训练环境提供了一种高性能的训练方法。针对MOE模型的稀疏专家计算,采用合并矩阵乘法的方法,模算效率得到大幅提升。

  基于在算法、数据和算力方面全面创新,源2.0-M32的性能得以大幅提升,在多个业界主流的评测任务中,展示出了较为先进的能力表现,在MATH(数学竞赛)、ARC-C(科学推理)榜单上超越了拥有700亿参数的LLaMA3大模型。

  源2.0-M32大幅提升了模型算力效率,在实现与业界领先开源大模型性能相当的同时,显著降低了在模型训练、微调和推理所需的算力开销。在模型推理运行阶段,M32处理每token所需算力为7.4GFLOPs,而LLaMA3-70B所需算力为140GFLOPs。在模型微调训练阶段,对1万条平均长度为1024 token的样本进行全量微调,M32消耗算力约0.0026PD(PetaFLOPs/s-day),而LLaMA3消耗算力约为0.05PD。M32凭借特别优化设计的模型架构,在仅激活37亿参数的情况下,取得了和700亿参数LLaMA3相当的性能水平,而所消耗算力仅为LLaMA3的1/19,从而实现了更高的模算效率。

  浪潮信息人工智能首席科学家吴韶华表示:当前业界大模型在性能不断提升的同时,也面临着所消耗算力大幅攀升的问题,对企业落地应用大模型带来了极大的困难和挑战。源2.0-M32是浪潮信息在大模型领域持续耕耘的最新探索成果,通过在算法、数据、算力等方面的全面创新,M32不仅可以提供与业界领先开源大模型相当的性能,更可以大幅降低大模型所需算力消耗。大幅提升的模算效率将为企业开发应用生成式AI提供模型高性能、算力低门槛的高效路径。M32开源大模型配合企业大模型开发平台EPAI(Enterprise Platform of AI),将助力企业实现更快的技术迭代与高效的应用落地,为人工智能产业的发展提供坚实的底座和成长的土壤,加速产业智能化进程。

  据悉,源2.0-M32将持续采用全面开源策略,全系列模型参数和代码均可免费下载使用。(柯岩)

[ 责编:战钊 ]
阅读剩余全文(
Image

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • Image
    开心
     
    0
  • Image
    难过
     
    0
  • Image
    点赞
     
    0
  • Image
    飘过
     
    0

视觉焦点

  • Image

    中国在世卫大会期间联合举办全民健康覆盖主题边会。

  • Image

    西部地区最大高铁枢纽站钢结构屋顶完工

独家策划

推荐阅读
由于量子比特非常敏感,需要将它们尽可能地与环境干扰隔离,因此新型制冷机也有助加快量子计算领域的创新。
2024-05-29 09:22
据物理学家组织网5月25日报道,美国科学家开发出一款新型人工智能(AI)工具,利用其分析磁共振成像(MRI)数据,以检测手臂下的淋巴结中是否存在乳腺癌细胞。
2024-05-29 09:22
花生属于豆科作物,能够与土壤中的根瘤菌共生结瘤固氮,将空气中的氮气转化为作物养分——氨。
2024-05-29 09:22
此项成果将有力推动高品质血橙功能基因研究和基因组进化研究工作,并为后续血橙特异基因挖掘和育种利用提供核心素材。
2024-05-29 09:21
我国科研人员最新研究表明,过去30年,青藏高原湖泊面积扩张超过1万平方公里;预估至21世纪末,由于降水增加和冰川融水补给,在低排放情景下,青藏高原湖泊面积将扩张约50%(增加约2万平方公里),水位上升约10米,水量增加约652千兆吨,水量增量是过去50年的4倍。这一成果由中国科学院青藏高原研究所环境变化与多圈层过程团队张国庆研究员等完成,相关论文27日在线发表于国际学术期刊《自然·地球科学》。
2024-05-29 04:55
前不久,四集广播剧《禾下乘凉梦》陆续在中央广播电视总台中国之声、文艺之声等播出。该剧以“杂交水稻之父”袁隆平的故事为创作蓝本,讲述他为实现人生两个梦想,即“让中国人端稳手中的饭碗”的“禾下乘凉梦”以及杂交水稻“覆盖全球梦”奋斗一生的事迹。
2024-05-29 04:55
近日,北京市民王先生家使用超过10年的旧洗衣机出现了故障,王先生决定购买一台新机,但家里这台旧机如何处理,让他犯了愁。经过对比选购,他最后在线下购得了一款洗干一体机。
2024-05-28 04:20
一年间,C919投入“京沪航线”、服务“春运”、飞出国门亮相新加坡航展……6月1日,东航将使用C919执飞“香港-上海”商业包机航班。
2024-05-28 09:03
中药材前处理设备、中药成分提取设备、中药制剂设备……走进位于湖南省宁乡市的医药装备企业楚天科技,仿佛走进了一家中药智能化生产技术与装备的大超市。
2024-05-28 04:20
近年来,伴随算法算力的不断进步和海量数据的持续累积,人工智能正在从“决策式”时代迈入“生成式”时代。
2024-05-28 04:30
湖南省长沙县吾悦广场,在配送站工作人员的指令下,一架无人机腾空而起,“抱”着顾客下单的货物进行空中配送。这是湖南省首条常态化低空物流应用航线。随着低空经济越来越火热,快递包裹从天而降的科幻场景,走进了更多市民的生活中。
2024-05-28 04:20
加快建设中国特色、世界一流的大学和优势学科,大力加强基础学科、新兴学科、交叉学科建设,不断提升原始创新能力和人才培养质量,是教育强国建设的重要内容。
2024-05-28 04:35
从中国科学院获悉,我国科研人员对浙江上山文化区水稻起源进行了研究,揭示了水稻从野生到驯化的连续演化史,这一过程跨越了十万年。
2024-05-27 02:55
从神农架国家公园管理局获悉,神农架新发现一个报春花科新种,研究成果近日发表在国际植物学期刊《植物钥匙》上。
2024-05-27 02:55
十几年来,我一直从事液体火箭发动机喷注燃烧系统相关产品高精密产品的研制生产任务。前辈们总是说,咱航天人如果没有一股子肯钻研的“倔”劲儿和对产品精益求精的追求,怎么攀登技术高峰?可见,我们的工作容不得半点马虎,因为产品的精度直接影响着火箭发动机及飞行器的精准入轨,丝毫差池都会导致火箭发射延误甚至失败。
2024-05-27 02:55
月球背面整体上相对月球正面更为古老,且存在月球三大地体之一的艾特肯盆地,具有重要科研价值。我们团队在赵淳生院士带领下研制的超声电机已应用在嫦娥六号探测器上,用于光谱仪驱动与控制。
2024-05-27 02:55
5月3日17时27分,嫦娥六号探测器由长征五号遥八运载火箭在中国文昌航天发射场成功发射,之后准确进入地月转移轨道,发射任务取得圆满成功。
2024-05-27 02:55
5月8日,嫦娥六号探测器成功实施近月制动,顺利进入环月轨道飞行。这一刻,在距飞控大厅不远的遥操作大厅,在数千公里之外的深空测控站,在准备下一次发射任务的卫星发射场,在与嫦娥六号任务相关的岗位上,处处可见中国航天人忙碌的身影。是他们,不断创造着一项又一项震惊世界的中国高度。
2024-05-27 02:55
本届峰会共对接签约数字经济项目421个、总投资2030亿元,涵盖数字产业、数字化转型、新基建等领域,将有助于打造高水平数字经济产业链,为做大做强做优福建数字经济注入新的动力。
2024-05-25 20:31
库布其沙漠鄂尔多斯中北部新能源基地施工现场,推土机正在推沙平整场地。” 
2024-05-24 09:41
加载更多