DeepSeek mHC : Hyper-Connections contraintes par une variété

Traduction automatique Cet article a été traduit automatiquement depuis la version originale en anglais.

Le deep learning moderne repose sur la connexion résiduelle. Les Hyper-Connections (HC) explorent une autre dimension architecturale : élargir l’état résiduel en plusieurs streams qui interagissent. L’article de DeepSeek sur les Manifold-Constrained Hyper-Connections (mHC) étudie comment maintenir la stabilité du routage à plus grande échelle d’entraînement.

Cet article commence par les connexions résiduelles standard, puis introduit les Hyper-Connections et l’instabilité qu’elles peuvent provoquer. La contrainte mHC et son coût d’implémentation sont présentés à la fin.

En bref : HC remplace un état résiduel unique par plusieurs streams et des maps apprises de lecture, d’écriture et de mélange. Ces maps non contraintes peuvent amplifier ou atténuer les signaux lorsqu’elles sont composées à travers les couches. mHC projette approximativement la map de mélange résiduelle sur le polytope de Birkhoff au moyen de 20 itérations de Sinkhorn-Knopp. L’article présente des expériences de mise à l’échelle sur 3B, 9B et 27B (sections 5.1 et 5.3), ainsi qu’un temps d’entraînement supplémentaire de 6,7 % pour quatre streams après l’optimisation des kernels et du scheduling (section 4.3).


Pourquoi les connexions résiduelles fonctionnent

Le problème de la profondeur

Ajouter des couches peut augmenter la capacité, mais rend également l’optimisation et la propagation des signaux plus difficiles. Selon l’initialisation, la normalisation et l’architecture, les activations forward ou les gradients backward peuvent diminuer, augmenter ou devenir mal conditionnés à mesure que la profondeur croît.

La solution résiduelle

L’article ResNet a introduit une solution simple. Au lieu d’apprendre une transformation directe, on apprend le résidu, c’est-à-dire la différence par rapport à l’identité :

Connexion résiduelle standardConnexion résiduelle standard

La propriété essentielle est le raccourci identité. Lorsque la fonction résiduelle F(x)F(x) renvoie zéro, la couche devient un simple passage direct. Deux conséquences en découlent :

  1. Un terme de gradient direct : la rétropropagation comprend un chemin passant par la composante identité.
  2. Une transformation de repli simple : la branche résiduelle peut rester proche de zéro lorsqu’une couche n’a pas besoin de modifier fortement l’état.

Cela n’élimine pas tous les problèmes d’optimisation, mais a rendu pratiques des réseaux nettement plus profonds.


Comment la normalisation par couche modifie le chemin résiduel

Les Transformers ont ajouté une nouvelle variable : l’emplacement de la Layer Normalization (LN). Ce choix semble mineur, mais ne l’est pas.

Compromis entre Post-LN et Pre-LNCompromis entre Post-LN et Pre-LN

VarianteEmplacement de LNAvantageLimitation principale
Post-LNAprès le bloc résiduelForte contribution à la profondeurPeut être plus difficile à optimiser en profondeur
Pre-LNAvant le bloc résiduelChemin résiduel plus directLes représentations de couches adjacentes peuvent devenir de plus en plus similaires

L’architecture ResiDual combine des chemins résiduels Pre-LN et Post-LN. HC élargit plutôt l’état résiduel.


Les Hyper-Connections ajoutent des streams résiduels parallèles

Les Hyper-Connections (HC) augmentent la largeur du residual stream au lieu d’ajouter de la profondeur.

Architecture des Hyper-ConnectionsArchitecture des Hyper-Connections

Ce que signifie un stream

Dans un Transformer standard, chaque token possède un état de dimension dd qui traverse les blocs. Au début du réseau, HC réplique nn fois cet embedding d’entrée, où nn est le « taux d’expansion », généralement égal à 4. L’état caché de dimension dd devient une « matrice hyper-cachée » n×dn \times d.

Dans les Hyper-Connections, un stream est l’une de ces nn instances parallèles de l’état.

Les copies commencent de manière identique, puis divergent lorsque des maps apprises lisent, écrivent et mélangent les streams. L’article les interprète comme plusieurs schémas de connexion à travers la profondeur ; il n’impose pas à chaque stream d’acquérir un rôle fixe et lisible par un humain.

Mécanismes fondamentaux

Au lieu d’un seul chemin résiduel, HC conserve nn streams parallèles dans tout le réseau. À chaque bloc Transformer, trois opérations sont exécutées, chacune contrôlée par de petits poids appris :

  1. Lecture (Hpre\mathcal{H}^{pre}) : agréger les nn streams en une entrée de dimension dd consommée par le bloc d’attention ou feed-forward.
  2. Écriture (Hpost\mathcal{H}^{post}) : projeter la sortie du bloc en mises à jour pour les nn streams.
  3. Mélange (Hres\mathcal{H}^{res}) : appliquer une map résiduelle n×nn \times n avant d’ajouter la mise à jour du bloc.

Ces maps peuvent être des paramètres statiques complétés par des termes dépendant de l’entrée. La map résiduelle est la partie critique pour la stabilité, car elle est multipliée de manière répétée à travers la profondeur.

Résultats rapportés dans l’article HC

Performances de HCPerformances de HC

L’article HC rapporte une convergence 1,8 fois plus rapide pour sa configuration OLMoE-1B-7B DHC×4 par rapport à sa baseline, ainsi que des gains en aval à 500B tokens (section 1). Il s’agit d’une configuration évaluée, et non d’un multiplicateur général de vitesse pour quatre streams.

Le problème de mise à l’échelle

L’article mHC rapporte une instabilité lorsque HC non contraint est mis à l’échelle jusqu’à sa configuration 27B.


Pourquoi HC non contraint peut devenir instable

Les mêmes maps non contraintes qui rendent HC flexible suppriment également le chemin identité garanti qui facilite l’entraînement des modèles résiduels.

Problème d’instabilité de HCProblème d’instabilité de HC

Le problème de la map composite

Dans les connexions résiduelles standard :

xl+1=xl+F(xl)x_{l+1} = x_l + F(x_l)

Lorsque F(x)0F(x) \rightarrow 0, il s’agit de l’identité : xl+1=xlx_{l+1} = x_l. Le signal traverse la couche sans modification.

Dans les Hyper-Connections, le chemin résiduel inclut une multiplication matricielle :

xl+1=Hlresxl+x_{l+1} = \mathbf{H}^{res}_l \cdot x_l + \dots

Sur L couches, le signal devient :

xL=HLres×HL1res××H1res×x0x_L = \mathbf{H}^{res}_L \times \mathbf{H}^{res}_{L-1} \times \dots \times \mathbf{H}^{res}_1 \times x_0

Le comportement dépend de la matrice composite, et non du fait que les entrées individuelles soient supérieures ou inférieures à 1. Si les gains opérateur de maps successives dépassent un dans une direction alignée, les signaux peuvent croître ; des gains inférieurs à un peuvent les atténuer. Des entrées négatives peuvent également provoquer des annulations.

L’article mHC mesure ce gain avec l’Amax Gain Magnitude : la somme maximale en valeur absolue des lignes pour la propagation forward et des colonnes pour la propagation backward dans une map résiduelle composite. Dans son expérience HC à 27B, le pic approche 3 000 et coïncide avec un comportement d’entraînement instable (section 5.4).

Cause fondamentale : perte de l’identitéCause fondamentale : perte de l’identité

L’objectif de conception est donc plus ciblé que d’imposer à chaque map d’être l’identité : autoriser le mélange entre streams tout en bornant l’amplification lors des compositions.


La contrainte mHC

mHC conserve le routage entre streams, mais contraint chaque matrice de mélange résiduelle au polytope de Birkhoff, c’est-à-dire l’ensemble des matrices bistochastiques. Une telle matrice possède des entrées non négatives, et chacune de ses lignes et colonnes a une somme égale à un. Cette contrainte fait de chaque stream de sortie une combinaison convexe des streams d’entrée et borne la norme spectrale de la map résiduelle à un.

La solution mHCLa solution mHC

Ce que garantit la bistochasticité

La bistochasticité apporte simultanément trois propriétés :

ContrainteConséquence
Non-négativitéChaque sortie est une combinaison convexe, sans annulation de signes
Somme des lignes = 1Un signal constant entre les streams reste constant
Somme des colonnes = 1La moyenne globale entre les streams est conservée

Il ne s’agit pas d’une conservation littérale de l’énergie euclidienne. Une map bistochastique peut lisser les différences entre les streams. Elle assure la conservation de la moyenne et un routage non expansif sous la borne de norme indiquée.

La contrainte a trois autres conséquences :

  1. Norme spectrale ≤ 1 : la map de routage résiduelle ne peut pas amplifier la norme euclidienne.
  2. Stabilité par multiplication : le produit de matrices bistochastiques reste bistochastique ; la contrainte est donc conservée lors de la composition à travers la profondeur.
  3. Mélange convexe : d’après le théorème de Birkhoff-von Neumann, la map appartient à l’enveloppe convexe des matrices de permutation.

Projection de Sinkhorn-Knopp

Les logits résiduels appris ne sont pas contraints. mHC les exponentie d’abord pour obtenir une matrice positive, puis alterne normalisation des colonnes et des lignes. Avec suffisamment d’itérations, ce processus de Sinkhorn-Knopp converge vers une matrice bistochastique ; l’article utilise 20 itérations comme projection différentiable pratique et approchée, plutôt que comme contrainte exacte.

Algorithme de Sinkhorn en détailAlgorithme de Sinkhorn en détail

Pour des logits bruts AA, la procédure est la suivante :

S = exp(A)
repeat 20 times:
    S = S / column_sum(S)
    S = S / row_sum(S)
return S

Les opérations sont différentiables, mais elles ne sont pas gratuites. mHC s’appuie sur un kernel forward fusionné et un kernel backward personnalisé qui recalcule les états intermédiaires de normalisation sur la puce.

Détails de la paramétrisation

  • Map résiduelle : l’exponentiation et la normalisation de Sinkhorn produisent la Hres\mathcal{H}^{res} approximativement bistochastique.
  • Maps de lecture et d’écriture : Hpre=σ(H~pre)\mathcal{H}^{pre}=\sigma(\tilde{\mathcal{H}}^{pre}) et Hpost=2σ(H~post)\mathcal{H}^{post}=2\sigma(\tilde{\mathcal{H}}^{post}). Les deux maps restent non négatives, ce qui réduit les annulations dues aux coefficients de signes mixtes (section 4.2).

Architecture mHC complète

Architecture mHC complèteArchitecture mHC complète

Le déroulement dans chaque bloc :

  1. Entrée : nn streams résiduels parallèles entrent dans la couche.
  2. Lecture (Hpre\mathcal{H}^{pre}) : les nn streams sont combinés pour former l’entrée consommée par la fonction de la couche. L’article utilise σ(H~pre)\sigma(\tilde{\mathcal{H}}^{pre}), ce qui rend les coefficients non négatifs.
  3. Calcul : le bloc Transformer standard (Attention ou MLP) traite le vecteur agrégé unique.
  4. Écriture (Hpost\mathcal{H}^{post}) : la sortie du bloc est transformée en mises à jour pour les nn streams avec 2σ(H~post)2\sigma(\tilde{\mathcal{H}}^{post}). Les coefficients restent non négatifs.
  5. Mélange (Hres\mathcal{H}^{res}) : la map résiduelle approximativement bistochastique mélange les streams entrants avant l’ajout de la mise à jour.
  6. Sortie : la matrice de streams mise à jour est transmise à la couche suivante.

Seule la map de mélange résiduelle utilise la projection de Sinkhorn. Les maps de lecture et d’écriture utilisent des paramétrisations non négatives. Cette distinction est importante, car la garantie de composition de l’article s’applique à Hres\mathcal{H}^{res}.


Infrastructure nécessaire pour le surcoût rapporté

Quatre streams augmentent les accès mémoire à l’état résiduel, le stockage des activations et les communications du pipeline. Le résultat de 6,7 % sur le temps d’exécution dépend de l’implémentation co-conçue suivante.

Fusion de kernels

L’implémentation fusionne les opérations qui partagent des accès mémoire, utilise la précision mixte lorsque c’est approprié et implémente la plupart des kernels personnalisés avec TileLang. La boucle de Sinkhorn et son passage backward personnalisé s’exécutent dans des kernels dédiés afin de réduire le trafic mémoire et le surcoût des lancements.

Recalcul sélectif

Stocker chaque état intermédiaire de Sinkhorn pour la rétropropagation ferait exploser la consommation mémoire. mHC procède donc ainsi :

  • Libère les activations intermédiaires après le passage forward.
  • Les recalcule à la volée pendant le passage backward.

Un scheduling DualPipe étendu superpose des portions de communication, de recalcul et de traitement des couches aux frontières du pipeline. Le niveau de recouvrement obtenu est spécifique à ce système d’entraînement.

Résultat système rapporté

Pour la configuration à grande échelle de l’article, le taux d’expansion n=4n=4 ajoute 6,7 % au temps d’entraînement par rapport à sa baseline (section 4.3). Il s’agit d’un résultat système, et non du surcoût d’une implémentation dans un framework standard.


Ce que les expériences établissent

Dans la comparaison à 27B, HC non contraint atteint un pic d’Amax Gain composite proche de 3 000. Avec une projection de Sinkhorn approchée en 20 étapes, le gain backward composite de mHC s’écarte de un, mais reste borné à environ 1,6 dans l’analyse rapportée (section 5.4).

Les auteurs entraînent également des variantes MoE inspirées de DeepSeek-V3 à 3B, 9B et 27B (section 5.3). À 27B, mHC surpasse la baseline à résidu standard sur les huit benchmarks downstream rapportés, et HC sur six des huit (tableau 4). HC obtient un score légèrement supérieur sur GSM8K et MATH. Il s’agit d’expériences de préentraînement internes menées par l’équipe à l’origine de la méthode ; la réplication indépendante et les comparaisons sur d’autres architectures restent donc ouvertes.


Compromis et questions ouvertes

mHC ne constitue pas un gain immédiat pour tous les modèles. Quatre questions restent ouvertes :

  1. Surcoût système : 6,7 % correspond au résultat optimisé de l’article ; un autre runtime, une autre topologie de périphériques ou une autre forme de modèle peuvent entraîner un coût différent.
  2. Complexité d’implémentation : une implémentation de référence peut exprimer la méthode, mais atteindre le throughput rapporté nécessite des kernels personnalisés, du recalcul et des modifications du scheduling.
  3. Biais de mélange : la bistochasticité conserve la moyenne inter-stream et empêche l’expansion via Hres\mathcal{H}^{res}, mais elle peut lisser les différences entre streams. La mise à jour du bloc modifie toujours la représentation globale.
  4. Portée des résultats : les éléments les plus solides concernent le préentraînement de modèles de langage sur des architectures MoE inspirées de DeepSeek-V3. La généralisation à d’autres familles de modèles n’est pas encore établie par cet article.

Points clés

  1. Les connexions résiduelles fonctionnent grâce au mapping identité : elles peuvent transmettre les signaux sans modification.
  2. Les Hyper-Connections augmentent la largeur plutôt que la profondeur, et l’article HC rapporte une convergence plus rapide pour une configuration à quatre streams.
  3. HC non contraint peut perdre la propriété de conservation résiduelle lorsque les maps résiduelles sont composées à travers la profondeur.
  4. mHC contraint le mélange résiduel au polytope de Birkhoff, conserve la moyenne inter-stream et borne l’amplification.
  5. Sinkhorn-Knopp rend la contrainte différentiable, ce qui permet un entraînement end-to-end.
  6. Le surcoût rapporté de 6,7 % est une réussite d’ingénierie système, et non une propriété de l’architecture seule.

mHC constitue une approche prometteuse pour étudier une topologie résiduelle plus large tout en maintenant une bonne condition numérique de la map résiduelle répétée. Son intérêt pour un autre modèle dépend de gains de qualité confirmés indépendamment et du coût nécessaire pour reproduire sa stack système.


Références