An Explorative Study on Distributed Computing Techniques in Training and Inference of Large Langu...

发布时间:2026/9/1 20:41:42
An Explorative Study on Distributed Computing Techniques in Training and Inference of Large Langu... 该文章聚焦大语言模型(LLM)训练与推理中的分布式计算技术,从“LLM平民化”和“LLM服务技术对比”两大方向展开研究,提出了PETALS系统的元启发式改进方案,并对比分析了三种主流LLM服务技术。一、文章主要内容1. 研究背景与基础概念LLM的核心挑战:千亿参数级LLM(如BLOOM-176B、OPT-175B)计算与内存需求极高,单节点无法支撑训练、微调与推理,需依赖分布式计算技术。分布式计算核心价值:通过多设备协同,实现并行处理、资源共享、容错性提升,解决LLM“算力门槛高”的问题,同时优化效率与可扩展性。关键基础:介绍了Transformer架构、自回归生成特性、KV缓存(键值缓存)等LLM核心组件,以及分布式推理中“服务器-客户端”协作模式(服务器托管模型层、客户端构建服务链)。2. 两大核心研究方向(1)LLM平民化:PETALS系统改进PETALS原系统:通过多节点资源池化,让消费级GPU可运行千亿参数LLM(如BLOOM-176B推理速度约1步/秒),但原“最优服务链选择”仅考虑单一目标(时间最短)。改进方案:引入NSGA-II算法(非支配排序遗传算法II),构建多目标优化模型