LLM-parallelisme: hoe verschillen TP, PP, DP en EP?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Tensorparallelisme verdeelt bewerkingen op weights. Pipelineparallelisme verdeelt lagen. Dataparallelisme bij serving draait onafhankelijke modelreplica’s. Expertparallelisme verdeelt de experts van een mixture-of-experts-model. Kies op basis van de benodigde geheugenruimte voor het model, het verkeer en de verbindingen tussen GPUs.

Dit zijn vier gangbare benaderingen. Grote deployments kunnen ze combineren, en training met lange contexten kan ook sequentie- of contextparallelisme gebruiken.

Wat slaat elke GPU op?

AanpakModelplaatsingCommunicatie om rekening mee te houden
Tensorparallelisme, TPDelen van weightmatricesFrequente collectieve bewerkingen tijdens de modeluitvoering
Pipelineparallelisme, PPGroepen opeenvolgende lagenActivations die tussen fasen worden doorgegeven
Dataparallelisme, DPVolledige servingreplica’sGeen modelberekeningen tussen replica’s voor onafhankelijke verzoeken
Expertparallelisme, EPVerschillende MoE-expertsTokens die naar experts worden gerouteerd, vaak via all-to-all-uitwisseling

DP bij training verschilt van servingreplica’s: training combineert gradiënten, en ZeRO of FSDP kan de trainingstoestand verdelen. MoE-systemen kunnen ook gedeelde componenten coördineren, zelfs wanneer een deel van het werk dataparallel gebeurt.

Het Llama 3-rapport beschrijft gecombineerd parallelisme voor het trainen van grote models en pipelineparallelle inference. De deployment laat zien waarom modelplaatsing en topologie samen moeten worden bekeken; het rapport stelt geen universele configuratie vast.

Kies de kleinste groep die de werklast aankan

Als een servingmodel op één GPU past met voldoende capaciteit voor de KV cache, test dan eerst onafhankelijke replica’s. Ze kunnen de totale throughput verhogen zonder collectieve bewerkingen aan elk verzoek toe te voegen.

Als het model meerdere GPUs nodig heeft, test dan TP binnen een node met snelle GPU-verbindingen. Meer shards kunnen het geheugen per GPU verlagen, maar voegen communicatie toe. Als het model over meerdere nodes is verdeeld, vergelijk dan PP en combinaties van TP en PP; ongelijke fasetijden en perioden waarin de pipeline niets uitvoert, kunnen de benutting verlagen.

Meet voor een MoE-model de expertplaatsing, de verdeling van tokens en het verkeer over de verbindingen voordat je EP toevoegt. Het beschikbare geheugen voor experts is slechts één onderdeel van de afweging.

Houd prompts, uitvoerlengtes, precisie en latencygrenzen constant bij de vergelijking. Rapporteer de throughput voor de volledige servinggroep; delen door het aantal GPU voorspelt niet hoe een andere topologie zal schalen.

De sectie over parallelisme in de LLM Engineering Guide toont de vier plaatsingen.