千卡训练有效时间占比超过95%，蚂蚁集团AI Infra技术开源

互联网 1 年前 0 4

本文介绍: 据了解，蚂蚁集团在人工智能领域持续进行技术投入，最近，蚂蚁集团在内部成立了AI创新研发部门NextEvo，承担了蚂蚁AI的所有核心技术研发，包含百灵大模型的所有研发工作，涉及AI算法、AI工程、NLP、AIGC等核心技术，并在布局多模态大模型、数字人等领域的技术研发和产品创新。作为自动化分布式深度学习系统，DLRover的“自动驾驶”功能模块还包括：Atorch，一种PyTorch分布式训练扩展库，在千亿参数模型千卡级别规模下，训练的算力利用率可达60%，帮助开发者进一步压榨硬件算力。

近日，蚂蚁集团AI创新研发部门NextEvo全面开源AI Infra技术，可帮助大模型千卡训练有效时间占比超过95%，能实现训练时“自动驾驶”，这推动了AI研发效率。

（图：蚂蚁集团的自动化分布式深度学习系统DLRover现已全面开源）

该技术框架名为DLRover，目标在于大规模分布式训练的智能化。目前很多企业的训练作业都是跑在混合部署的集群中，运行环境复杂多变，不管多么“崎岖的地形”，DLRover都可以“轻松行驶”。

2023 年大模型技术的发展，带来了工程实践的爆发，如何管理数据，提高训练和推理效率，最大化利用现有算力，成了关键一环。

完成一个千亿参数级别的大模型，如GPT-3，用一张卡训练一次要耗时32年，那么训练时的算力利用尤为重要。方法之一是把能用的算力用得更好，比如进一步压榨已购买GPU的性能；二是把以前利用不了的算力用起来，比如CPU、内存等，这就需要通过异构计算平台来解决。

显示所有内容

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

ai 蚂蚁训练

相关文章

软考21-上午题-数组、矩阵

互联网 1 年前 4

使用deepspeed继续训练LLAMA

使用deepspeed继续训练LLAMA

互联网 1 年前 3

第七届西湖论剑·中国杭州网络安全技能大赛 AI 回声海螺 WP

第七届西湖论剑·中国杭州网络安全技能大赛 AI 回声海螺 WP

互联网 1 年前 7

ChatGPT学习第一周

chatgpt 1 年前 3

与AI对话：编写高效Prompt的指南

与AI对话：编写高效Prompt的指南

互联网 1 年前 6

JVM之GC垃圾回收

互联网 1 年前 4

行为型设计模式—中介者模式

互联网 1 年前 5

发表回复取消回复