DeepSeek mHC: Hyper-Connections restringidas a una variedad

Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.

El deep learning moderno se apoya en la conexión residual. Las Hyper-Connections (HC) exploran otra dimensión arquitectónica: ampliar el estado residual en varios streams que interactúan entre sí. El artículo de DeepSeek sobre Manifold-Constrained Hyper-Connections (mHC) estudia cómo mantener estable ese routing al escalar el entrenamiento.

Esta publicación comienza con las conexiones residuales estándar y después introduce las Hyper-Connections y la inestabilidad que pueden provocar. La restricción de mHC y su coste de implementación se abordan al final.


Por qué funcionan las conexiones residuales

El problema de la profundidad

Añadir capas puede aumentar la capacidad, pero también dificulta la optimización y la propagación de señales. Dependiendo de la inicialización, la normalización y la arquitectura, las activaciones forward o los gradientes backward pueden reducirse, crecer o quedar mal condicionados a medida que aumenta la profundidad.

La solución residual

El artículo de ResNet introdujo una solución sencilla. En lugar de aprender un mapeo directo, se aprende el residual, es decir, la diferencia respecto a la identidad:

Conexión residual estándarConexión residual estándar

La propiedad clave es el atajo de identidad. Cuando la función residual F(x)F(x) devuelve cero, la capa se convierte en un pass-through. De aquí se derivan dos consecuencias:

  1. Un término de gradiente directo: la backpropagation incluye un camino a través del componente de identidad.
  2. Un mapeo de fallback sencillo: la rama residual puede mantenerse cerca de cero cuando una capa no necesita modificar demasiado el estado.

Esto no elimina todos los problemas de optimización, pero hizo viables redes considerablemente más profundas.


Cómo cambia la normalización de capas el camino residual

Los Transformers introdujeron una nueva variable: dónde colocar Layer Normalization (LN). La decisión parece menor, pero no lo es.

Compromisos entre Post-LN y Pre-LNCompromisos entre Post-LN y Pre-LN

VarianteUbicación de LNVentajaLimitación principal
Post-LNDespués del bloque residualMayor contribución de la profundidadPuede ser más difícil de optimizar en redes profundas
Pre-LNAntes del bloque residualCamino residual más directoLas representaciones de capas adyacentes pueden volverse cada vez más similares

La arquitectura ResiDual combina caminos residuales Pre-LN y Post-LN. HC amplía el estado residual en lugar de aumentar la profundidad.


Las Hyper-Connections añaden streams residuales paralelos

Hyper-Connections (HC) amplía la anchura del residual stream en lugar de añadir profundidad.

Arquitectura de Hyper-ConnectionsArquitectura de Hyper-Connections

Qué significa un stream

En un Transformer estándar, cada token tiene un estado de dimensión dd que atraviesa los bloques. Al principio de la red, HC replica nn veces ese embedding de entrada, donde nn es la «tasa de expansión», normalmente 4. El estado oculto de dimensión dd se convierte en una «matriz oculta hiper» n×dn \times d.

En Hyper-Connections, un stream es una de esas nn instancias paralelas del estado.

Las copias comienzan siendo idénticas y después divergen a medida que los mapas aprendidos leen, escriben y mezclan los streams. El artículo las interpreta como varios patrones de conexión a lo largo de la profundidad; no exige que cada stream adopte un papel fijo y legible para una persona.

Mecanismos principales

En lugar de una única ruta residual, HC mantiene nn streams paralelos a través de toda la red. En cada bloque Transformer se ejecutan tres operaciones, cada una controlada por pequeños pesos aprendibles:

  1. Lectura (Hpre\mathcal{H}^{pre}): agrega los nn streams en la entrada de dimensión dd que consume el bloque de attention o feed-forward.
  2. Escritura (Hpost\mathcal{H}^{post}): transforma la salida del bloque en actualizaciones para los nn streams.
  3. Mezcla (Hres\mathcal{H}^{res}): aplica un mapa residual n×nn \times n antes de añadir la actualización del bloque.

Estos mapas pueden ser parámetros estáticos más términos dependientes de la entrada. El mapa residual es la parte crítica para la estabilidad, porque se multiplica repetidamente a lo largo de la profundidad.

Qué resultados presenta el artículo de HC

Rendimiento de HCRendimiento de HC

El artículo de HC informa de una convergencia 1,8 veces más rápida para su configuración OLMoE-1B-7B DHC×4 respecto a su baseline, además de mejoras downstream con 500B tokens (Sección 1). Se trata de una configuración evaluada, no de un multiplicador general de velocidad para cuatro streams.

El problema del escalado

El artículo de mHC informa de inestabilidad al escalar HC sin restricciones hasta su configuración de 27B.


Por qué HC sin restricciones puede volverse inestable

Los mismos mapas sin restricciones que hacen flexible a HC también eliminan el camino de identidad garantizado que facilita el entrenamiento de las conexiones residuales.

Problema de inestabilidad de HCProblema de inestabilidad de HC

El problema del mapa compuesto

En los residuales estándar:

xl+1=xl+F(xl)x_{l+1} = x_l + F(x_l)

Cuando F(x)0F(x) \rightarrow 0, esto es la identidad: xl+1=xlx_{l+1} = x_l. La señal pasa sin cambios.

En Hyper-Connections, el camino residual incluye una multiplicación matricial:

xl+1=Hlresxl+x_{l+1} = \mathbf{H}^{res}_l \cdot x_l + \dots

A lo largo de L capas, la señal se convierte en:

xL=HLres×HL1res××H1res×x0x_L = \mathbf{H}^{res}_L \times \mathbf{H}^{res}_{L-1} \times \dots \times \mathbf{H}^{res}_1 \times x_0

El comportamiento depende de la matriz compuesta, no de que las entradas individuales estén por encima o por debajo de 1. Si los mapas sucesivos tienen ganancias de operador superiores a uno en una dirección alineada, las señales pueden crecer; las ganancias inferiores a uno pueden atenuarlas. Las entradas negativas también pueden introducir cancelaciones.

El artículo de mHC mide esa ganancia mediante Amax Gain Magnitude: la suma máxima de los valores absolutos por fila para la propagación forward y por columna para la propagación backward en un mapa residual compuesto. En su experimento de HC con 27B, el pico se aproxima a 3.000 y coincide con un comportamiento de entrenamiento inestable (Sección 5.4).

La causa raíz: pérdida de la identidadLa causa raíz: pérdida de la identidad

Por tanto, el objetivo de diseño es más concreto que imponer que cada mapa sea la identidad: permitir la mezcla entre streams y, al mismo tiempo, acotar la amplificación al componer los mapas.


La restricción de mHC

mHC mantiene el routing entre streams, pero restringe cada matriz de mezcla residual al politopo de Birkhoff, el conjunto de matrices doblemente estocásticas. Estas matrices tienen entradas no negativas, y la suma de cada fila y cada columna es uno. La restricción hace que cada stream de salida sea una combinación convexa de los streams de entrada y acota la norma espectral del mapa residual a uno.

La solución de mHCLa solución de mHC

Qué garantiza la doble estocasticidad

La doble estocasticidad proporciona tres propiedades a la vez:

RestricciónConsecuencia
No negatividadCada salida es una combinación convexa, sin cancelación de signos
Suma de filas = 1Una señal constante entre streams permanece constante
Suma de columnas = 1Se conserva la media global entre streams

Esto no equivale a una conservación literal de la energía euclídea. Un mapa doblemente estocástico puede suavizar las diferencias entre streams. Proporciona conservación de la media y un routing no expansivo bajo la cota de norma indicada.

La restricción tiene además tres consecuencias:

  1. Norma espectral ≤ 1: el mapa de routing residual no puede amplificar la norma euclídea.
  2. Cerradura frente a la multiplicación: el producto de matrices doblemente estocásticas sigue siendo doblemente estocástico, por lo que la restricción se conserva al componerlas a lo largo de la profundidad.
  3. Mezcla convexa: según el teorema de Birkhoff-von Neumann, el mapa pertenece a la envolvente convexa de las matrices de permutación.

Proyección de Sinkhorn-Knopp

Los logits residuales aprendibles no están restringidos. mHC primero los eleva mediante la exponencial para obtener una matriz positiva y después alterna la normalización por columnas y por filas. Con suficientes iteraciones, este proceso de Sinkhorn-Knopp se aproxima a una matriz doblemente estocástica; el artículo utiliza 20 iteraciones como una proyección diferenciable aproximada y práctica, no como una restricción exacta.

Algoritmo de Sinkhorn detalladoAlgoritmo de Sinkhorn detallado

Para unos logits sin procesar AA, el procedimiento es:

S = exp(A)
repeat 20 times:
    S = S / column_sum(S)
    S = S / row_sum(S)
return S

Las operaciones son diferenciables, pero no son gratuitas. mHC utiliza un kernel forward fusionado y un kernel backward personalizado que vuelve a calcular en el chip los estados intermedios de normalización.

Detalles de la parametrización

  • Mapa residual: la exponenciación seguida de la normalización de Sinkhorn produce el Hres\mathcal{H}^{res} aproximadamente doblemente estocástico.
  • Mapas de lectura y escritura: Hpre=σ(H~pre)\mathcal{H}^{pre}=\sigma(\tilde{\mathcal{H}}^{pre}) y Hpost=2σ(H~post)\mathcal{H}^{post}=2\sigma(\tilde{\mathcal{H}}^{post}). Ambos mapas siguen utilizando valores no negativos, lo que reduce la cancelación debida a coeficientes con signos mixtos (Sección 4.2).

Arquitectura completa de mHC

Arquitectura completa de mHCArquitectura completa de mHC

El flujo a través de cada bloque es el siguiente:

  1. Entrada: nn streams residuales paralelos entran en la capa.
  2. Lectura (Hpre\mathcal{H}^{pre}): los nn streams se combinan en la entrada que consume la función de la capa. El artículo utiliza σ(H~pre)\sigma(\tilde{\mathcal{H}}^{pre}), lo que hace que los coeficientes sean no negativos.
  3. Cálculo: el bloque Transformer estándar (Attention o MLP) procesa el vector agregado único.
  4. Escritura (Hpost\mathcal{H}^{post}): la salida del bloque se transforma en actualizaciones para los nn streams mediante 2σ(H~post)2\sigma(\tilde{\mathcal{H}}^{post}). Los coeficientes siguen siendo no negativos.
  5. Mezcla (Hres\mathcal{H}^{res}): el mapa residual aproximadamente doblemente estocástico mezcla los streams entrantes antes de añadir la actualización.
  6. Salida: la matriz de streams actualizada pasa a la capa siguiente.

Solo el mapa de mezcla residual utiliza la proyección de Sinkhorn. Los mapas de lectura y escritura emplean parametrizaciones no negativas. Esta distinción es importante porque la garantía de composición del artículo se aplica a Hres\mathcal{H}^{res}.


Infraestructura necesaria para el overhead comunicado

Cuatro streams aumentan el acceso a memoria del estado residual, el almacenamiento de activaciones y la comunicación de la pipeline. El resultado temporal del 6,7 % que presenta el artículo depende de la siguiente implementación diseñada conjuntamente.

Fusión de kernels

La implementación fusiona operaciones que comparten accesos a memoria, utiliza precisión mixta cuando es apropiado e implementa la mayoría de los kernels personalizados con TileLang. El bucle de Sinkhorn y su backward personalizado se ejecutan dentro de kernels dedicados para reducir el tráfico de memoria y el overhead de lanzamiento.

Recomputación selectiva

Almacenar todos los estados intermedios de Sinkhorn para la backpropagation dispararía el consumo de memoria. En su lugar, mHC:

  • Libera las activaciones intermedias después del forward.
  • Las vuelve a calcular sobre la marcha durante el backward.

Una planificación DualPipe ampliada solapa partes de la comunicación, la recomputación y el trabajo de las capas en los límites de la pipeline. El solapamiento conseguido es específico de este sistema de entrenamiento.

Resultado comunicado del sistema

En la configuración de escalado del artículo, la tasa de expansión n=4n=4 añade un 6,7 % de tiempo de entrenamiento respecto a su baseline (Sección 4.3). Es un resultado del sistema, no el overhead de una implementación sencilla en un framework.


Qué establecen los experimentos

En la comparación con 27B, HC sin restricciones alcanza una ganancia Amax Gain compuesta cercana a 3.000. Con la proyección Sinkhorn aproximada de 20 pasos, la ganancia backward compuesta de mHC se desvía de uno, pero permanece acotada aproximadamente en 1,6 en el análisis comunicado (Sección 5.4).

Los autores también entrenan variantes MoE de 3B, 9B y 27B inspiradas en DeepSeek-V3 (Sección 5.3). En 27B, mHC supera al baseline residual estándar en los ocho benchmarks downstream comunicados y supera a HC en seis de ocho (Tabla 4). HC obtiene una puntuación ligeramente superior en GSM8K y MATH. Se trata de experimentos de pretraining internos del equipo que propone el método, por lo que la replicación independiente y las comparaciones con otras arquitecturas siguen abiertas.


Compromisos y preguntas abiertas

mHC no es una mejora drop-in para cualquier modelo. Quedan cuatro cuestiones:

  1. Overhead del sistema: el 6,7 % es el resultado del artículo con una implementación optimizada; otro runtime, topología de dispositivos o configuración del modelo puede tener un coste diferente.
  2. Complejidad de implementación: una implementación de referencia puede expresar el método, pero igualar el throughput comunicado requiere kernels personalizados, recomputación y cambios en la planificación.
  3. Sesgo de la mezcla: la doble estocasticidad conserva la media entre streams y evita la expansión mediante Hres\mathcal{H}^{res}, pero puede suavizar las diferencias entre streams. La actualización del bloque sigue modificando la representación global.
  4. Alcance de la evidencia: la evidencia más sólida procede del pretraining de modelos de lenguaje sobre arquitecturas MoE inspiradas en DeepSeek-V3. Este artículo todavía no establece la generalización a otras familias de modelos.

Ideas clave

  1. Las conexiones residuales funcionan gracias al mapeo de identidad: permiten que las señales pasen sin cambios.
  2. Hyper-Connections escalan la anchura en lugar de la profundidad, y el artículo de HC comunica una convergencia más rápida para una configuración concreta de cuatro streams.
  3. HC sin restricciones puede perder la propiedad de conservación residual cuando los mapas residuales se componen a lo largo de la profundidad.
  4. mHC restringe la mezcla residual al politopo de Birkhoff, conserva la media entre streams y acota la amplificación.
  5. Sinkhorn-Knopp hace diferenciable la restricción, lo que permite el entrenamiento end-to-end.
  6. El overhead comunicado del 6,7 % es un logro de sistemas, no una propiedad exclusiva de la arquitectura.

mHC es una forma prometedora de estudiar una topología residual más ancha manteniendo bien condicionado el mapa residual repetido. Que merezca la pena para otro modelo depende de las mejoras de calidad independientes y del coste de reproducir su stack de sistemas.


Referencias