DeepSeek mHC: Hyper-Connections с ограничением на многообразии

Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.

Современный deep learning опирается на residual connection. Hyper-Connections (HC) исследуют другое измерение архитектуры: расширение residual state до нескольких взаимодействующих потоков. В статье DeepSeek о Manifold-Constrained Hyper-Connections (mHC) изучается, как сохранить стабильность такого роутинга при масштабировании обучения.

В этом посте мы начнём со стандартных residual connections, затем добавим Hyper-Connections и разберём вызываемую ими нестабильность. В конце рассмотрим ограничение mHC и стоимость его реализации.


Почему residual connections работают

Проблема глубины

Добавление слоёв может увеличить ёмкость модели, но одновременно усложняет оптимизацию и передачу сигналов. В зависимости от инициализации, нормализации и архитектуры forward-активации или backward-градиенты могут затухать, расти или становиться плохо обусловленными по мере увеличения глубины.

Решение с residual connection

В статье ResNet было предложено простое решение. Вместо прямого отображения модель обучает residual — отличие от identity:

Стандартная residual connectionСтандартная residual connection

Полезное свойство здесь — identity shortcut. Когда residual function F(x)F(x) выдаёт ноль, слой превращается в pass-through. Отсюда следуют два эффекта:

  1. Прямой градиентный член: backpropagation получает путь через identity-компоненту.
  2. Простое отображение по умолчанию: residual branch может оставаться близкой к нулю, если слою не нужно сильно менять state.

Это не устраняет все проблемы оптимизации, но делает существенно более глубокие сети практически применимыми.


Как layer normalization меняет residual path

Transformers добавили новую переменную: куда поместить Layer Normalization (LN). Это решение кажется незначительным, но таковым не является.

Компромиссы Post-LN и Pre-LNКомпромиссы Post-LN и Pre-LN

ВариантРасположение LNПреимуществоОсновное ограничение
Post-LNПосле residual blockСущественный вклад глубиныНа большой глубине оптимизация может быть сложнее
Pre-LNПеред residual blockБолее прямой residual pathПредставления соседних слоёв могут становиться всё более похожими

Архитектура ResiDual объединяет residual paths Pre-LN и Post-LN. HC вместо этого расширяет residual state.


Hyper-Connections добавляют параллельные residual streams

Hyper-Connections (HC) увеличивают ширину residual stream, а не глубину.

Архитектура Hyper-ConnectionsАрхитектура Hyper-Connections

Что означает stream

В стандартном Transformer каждый токен имеет state размерности dd, который проходит через блоки. В начале сети HC реплицирует этот input embedding nn раз, где nn — это «коэффициент расширения», обычно равный 4. Скрытый state размерности dd превращается в n×dn \times d «hyper hidden matrix».

В Hyper-Connections stream — это один из nn параллельных экземпляров state.

Копии начинают идентичными, а затем расходятся, поскольку обучаемые карты читают данные из потоков, записывают в них и смешивают их. В статье они интерпретируются как несколько паттернов соединений по глубине; при этом не предполагается, что каждый поток приобретёт фиксированную и понятную человеку роль.

Основные механизмы

Вместо одного residual pathway HC поддерживает nn параллельных потоков, проходящих через всю сеть. На каждом transformer block выполняются три операции, каждая управляется небольшими обучаемыми весами:

  1. Read (Hpre\mathcal{H}^{pre}): агрегирует nn потоков в input размерности dd, который поступает в attention или feed-forward block.
  2. Write (Hpost\mathcal{H}^{post}): преобразует output этого блока в обновления для nn потоков.
  3. Mix (Hres\mathcal{H}^{res}): применяет n×nn \times n residual map перед добавлением обновления блока.

Эти карты могут состоять из статических параметров и зависящих от input членов. Residual map критична для стабильности, поскольку она многократно перемножается по глубине.

Что сообщает статья об HC

Производительность HCПроизводительность HC

В статье об HC сообщается о 1,8× более быстрой сходимости для конфигурации OLMoE-1B-7B DHC×4 относительно baseline, а также о приросте на downstream-задачах при 500B токенов (раздел 1). Это результат для одной оценённой конфигурации, а не универсальный множитель ускорения для четырёх потоков.

Проблема масштабирования

В статье о mHC сообщается о нестабильности при масштабировании неограниченного HC до конфигурации 27B.


Почему неограниченный HC может стать нестабильным

Те же неограниченные карты, которые делают HC гибким, одновременно устраняют гарантированный identity path, благодаря которому residual connections проще обучать.

Проблема нестабильности HCПроблема нестабильности HC

Проблема composite map

Для стандартных residual connections:

xl+1=xl+F(xl)x_{l+1} = x_l + F(x_l)

При F(x)0F(x) \rightarrow 0 это identity: xl+1=xlx_{l+1} = x_l. Сигнал проходит без изменений.

В Hyper-Connections residual path включает умножение матриц:

xl+1=Hlresxl+x_{l+1} = \mathbf{H}^{res}_l \cdot x_l + \dots

Для L слоёв сигнал принимает вид:

xL=HLres×HL1res××H1res×x0x_L = \mathbf{H}^{res}_L \times \mathbf{H}^{res}_{L-1} \times \dots \times \mathbf{H}^{res}_1 \times x_0

Поведение определяется composite matrix, а не тем, больше или меньше 1 отдельные элементы. Если последовательные карты имеют operator gain больше единицы в одном и том же направлении, сигналы могут расти; gain меньше единицы приводит к их затуханию. Отрицательные элементы также могут вызывать взаимную компенсацию.

В статье о mHC это усиление измеряется с помощью Amax Gain Magnitude: максимальной абсолютной суммы строк для forward propagation и суммы столбцов для backward propagation в composite residual map. В эксперименте с HC для модели 27B пиковое значение приближается к 3 000 и совпадает с нестабильным поведением обучения (раздел 5.4).

Корневая причина: потеря identityКорневая причина: потеря identity

Таким образом, цель архитектуры не в том, чтобы принудительно сделать каждую карту identity, а в том, чтобы разрешить смешивание потоков и одновременно ограничить усиление при композиции карт.


Ограничение mHC

mHC сохраняет роутинг между потоками, но ограничивает каждую residual mixing matrix многогранником Биркгофа — множеством двояковостохастичных матриц. Такая матрица имеет неотрицательные элементы, а сумма элементов в каждой строке и каждом столбце равна единице. Благодаря этому каждый output stream становится выпуклой комбинацией input streams, а спектральная норма residual map ограничивается единицей.

Решение mHCРешение mHC

Что гарантирует двояковосточность

Двояковосточность одновременно даёт три свойства:

ОграничениеСледствие
НеотрицательностьКаждый output — выпуклая комбинация без компенсации знаков
Сумма строки = 1Постоянный по потокам сигнал остаётся постоянным
Сумма столбца = 1Глобальное среднее по потокам сохраняется

Речь не идёт о буквальном сохранении евклидовой энергии. Двояковостохастичная карта может сглаживать различия между потоками. Она сохраняет среднее и обеспечивает нерасширяющий роутинг при указанном ограничении нормы.

У ограничения есть ещё три следствия:

  1. Спектральная норма ≤ 1: residual routing map не может увеличивать евклидову норму.
  2. Замкнутость относительно умножения: произведение двояковостохастичных матриц остаётся двояковостохастичным, поэтому ограничение сохраняется при композиции по глубине.
  3. Выпуклое смешивание: согласно теореме Биркгофа — фон Неймана, карта лежит в выпуклой оболочке матриц перестановок.

Проекция Sinkhorn-Knopp

Обучаемые residual logits не ограничены. Сначала mHC экспоненцирует их, получая положительную матрицу, а затем поочерёдно нормализует столбцы и строки. При достаточном числе итераций этот процесс Sinkhorn-Knopp приближается к двояковостохастичной матрице; в статье используются 20 итераций как практическая приближённая дифференцируемая проекция, а не как точное ограничение.

Алгоритм Sinkhorn подробноАлгоритм Sinkhorn подробно

Для исходных logits AA процедура выглядит так:

S = exp(A)
repeat 20 times:
    S = S / column_sum(S)
    S = S / row_sum(S)
return S

Операции дифференцируемы, но не бесплатны. mHC использует fused forward kernel и кастомное backward kernel, которое повторно вычисляет промежуточные состояния нормализации непосредственно на чипе.

Детали параметризации

  • Residual map: экспоненцирование и нормализация Sinkhorn дают приближённо двояковостохастичную матрицу Hres\mathcal{H}^{res}.
  • Read и write maps: Hpre=σ(H~pre)\mathcal{H}^{pre}=\sigma(\tilde{\mathcal{H}}^{pre}) и Hpost=2σ(H~post)\mathcal{H}^{post}=2\sigma(\tilde{\mathcal{H}}^{post}). Обе карты сохраняют неотрицательность, уменьшая компенсацию со стороны коэффициентов разных знаков (раздел 4.2).

Полная архитектура mHC

Полная архитектура mHCПолная архитектура mHC

Поток данных через каждый блок:

  1. Input: в слой поступают nn параллельных residual streams.
  2. Read (Hpre\mathcal{H}^{pre}): nn потоков объединяются во вход, который получает layer function. В статье используется σ(H~pre)\sigma(\tilde{\mathcal{H}}^{pre}), поэтому коэффициенты неотрицательны.
  3. Computation: стандартный блок Transformer (Attention или MLP) обрабатывает один агрегированный вектор.
  4. Write (Hpost\mathcal{H}^{post}): output блока преобразуется в обновления для nn потоков с помощью 2σ(H~post)2\sigma(\tilde{\mathcal{H}}^{post}). Коэффициенты остаются неотрицательными.
  5. Mix (Hres\mathcal{H}^{res}): приближённо двояковостохастичная residual map смешивает входящие потоки перед добавлением обновления.
  6. Output: обновлённая матрица потоков передаётся на следующий слой.

Только residual mixing map использует проекцию Sinkhorn. Для read и write maps применяются неотрицательные параметризации. Это различие важно, поскольку гарантия композиции из статьи относится к Hres\mathcal{H}^{res}.


Инфраструктура, необходимая для заявленных накладных расходов

Четыре потока увеличивают объём обращений к памяти для residual state, хранение активаций и обмен данными в пайплайне. Заявленный результат в 6,7% зависит от следующей совместно спроектированной реализации.

Объединение ядер

Реализация объединяет операции с общим доступом к памяти, использует mixed precision там, где это уместно, а большинство кастомных ядер написано с помощью TileLang. Цикл Sinkhorn и его кастомный backward pass выполняются внутри выделенных ядер, что снижает трафик памяти и накладные расходы на запуск.

Выборочный recomputation

Хранение каждого промежуточного состояния Sinkhorn для backpropagation привело бы к резкому росту потребления памяти. Поэтому mHC:

  • Освобождает промежуточные активации после forward pass.
  • Повторно вычисляет их на лету во время backward pass.

Расширенное расписание DualPipe перекрывает части коммуникаций, повторных вычислений и работы слоёв на границах pipeline. Достигнутый уровень перекрытия специфичен для этой training system.

Заявленный системный результат

В крупномасштабной конфигурации статьи коэффициент расширения n=4n=4 добавляет 6,7% ко времени обучения относительно baseline (раздел 4.3). Это системный результат, а не накладные расходы простой реализации на базе фреймворка.


Что показывают эксперименты

В сравнении для 27B неограниченный HC достигает пикового composite Amax Gain около 3 000. При приближённой проекции Sinkhorn за 20 шагов composite backward gain у mHC отклоняется от единицы, но остаётся ограниченным примерно значением 1,6 в представленном анализе (раздел 5.4).

Авторы также обучают варианты MoE на 3B, 9B и 27B, вдохновлённые DeepSeek-V3 (раздел 5.3). На 27B mHC превосходит стандартный residual baseline на всех восьми представленных downstream-бенчмарках, а HC — на шести из восьми (таблица 4). HC немного лучше на GSM8K и MATH. Это эксперименты с претрейнингом, проведённые командой авторов, поэтому независимая репликация и сравнение на других архитектурах остаются открытыми вопросами.


Компромиссы и открытые вопросы

mHC не является универсальным улучшением, которое можно бездумно добавить в любую модель. Остаются четыре вопроса:

  1. Системные накладные расходы: 6,7% — это оптимизированный результат из статьи; другой рантайм, топология устройств или форма модели могут привести к иной стоимости.
  2. Сложность реализации: reference implementation может выразить этот метод, но для достижения заявленного throughput потребуются кастомные ядра, recomputation и изменения расписания.
  3. Смещение из-за смешивания: двояковосточность сохраняет среднее между потоками и предотвращает расширение через Hres\mathcal{H}^{res}, но может сглаживать различия между потоками. Обновление блока по-прежнему меняет итоговое представление.
  4. Область применимости доказательств: наиболее сильные результаты получены на претрейнинге языковых моделей в архитектурах MoE, вдохновлённых DeepSeek-V3. Обобщаемость на другие семейства моделей пока не подтверждена этой статьёй.

Ключевые выводы

  1. Residual connections работают благодаря identity mapping — возможности передавать сигналы без изменений.
  2. Hyper-Connections масштабируют ширину, а не глубину, и в статье об HC сообщается об ускорении сходимости для одной конфигурации с четырьмя потоками.
  3. Неограниченный HC может потерять свойство сохранения residual path, когда residual maps компонуются по глубине.
  4. mHC ограничивает residual mixing многогранником Биркгофа, сохраняя среднее между потоками и ограничивая усиление.
  5. Sinkhorn-Knopp делает ограничение дифференцируемым, что позволяет обучать модель end-to-end.
  6. Заявленные накладные расходы в 6,7% — достижение системной оптимизации, а не свойство одной лишь архитектуры.

mHC — перспективный подход к исследованию более широкой residual topology при сохранении хорошей обусловленности многократно применяемой residual map. Целесообразность этого подхода для другой модели зависит от независимого прироста качества и стоимости воспроизведения используемого systems stack.


Литература