Следующий рубеж машинного интеллекта заключается не в генерации лучших слов. Он заключается в рассуждениях в пространстве, где слов еще не существует.
Когда вы решаете сложную математическую задачу, вы не проговариваете каждый микрошаг вслух самому себе. Когда вы идете по переполненной комнате, вы не составляете мысленно предложение, описывающее каждое препятствие, прежде чем обойти его. Человеческое познание функционирует по большей части под поверхностью языка — в богатом, непрерывном пространстве абстрактных отношений, пространственных интуиций и параллельных гипотез.
Современный ИИ добился замечательных успехов, обучаясь на основе языка. Но по мере того как исследователи продвигаются к более сложным задачам рассуждения, возникает закономерный вопрос: что происходит, когда мышление уходит глубже слов?
Этот вопрос указывает на латентное пространство — и это одна из важнейших идей, формирующих следующее поколение архитектур ИИ.
Как думают языковые модели
Большие языковые модели (LLM), построенные на архитектуре Transformer, добились исключительных успехов. Обученные на огромных массивах текста, они учатся предсказанию следующего токена в последовательности — цели, которая в масштабе создает системы с впечатляющей беглостью речи, широкими знаниями и высокой производительностью в самых разных задачах.
Поскольку эти модели генерируют язык по одному токену за раз, их рассуждения естественным образом разворачиваются таким же образом: последовательно, слово за словом. Такие методы, как пошаговый промптинг (chain-of-thought), развивают эту концепцию дальше, побуждая модели «демонстрировать ход мысли» путем генерации явных промежуточных шагов перед тем, как прийти к ответу.
Этот подход хорошо работает для многих проблем. Но он также обнаруживает естественное ограничение: каждый шаг рассуждения модели должен быть выражим в виде дискретного слова или токена. Сложные пространственные отношения, абстрактные логические структуры и многомерные состояния рассуждения не всегда четко отображаются на естественный язык — и их сжатие через этот канал создает издержки и неточности.
Что такое латентное пространство?
Каждая нейронная сеть оперирует векторами — многомерными числовыми представлениями концептов, отношений и состояний. Эти векторы существуют в том, что исследователи называют латентным пространством: внутренней репрезентативной доменной областью, которая существует до и независимо от любого языкового вывода.
Латентное пространство значительно более выразительно, чем словарный запас. Там, где слово навязывает дискретное обязательство, непрерывный латентный вектор может одновременно кодировать оттенки неопределенности, конкурирующие гипотезы и реляционную структуру. Оно может удерживать множество возможностей в суперпозиции до тех пор, пока не появится достаточно информации для их разрешения.
Когнитивная наука предлагает здесь убедительную параллель. Исследования пациентов с тяжелой азией (утративших способность производить или понимать язык) показывают, что сложное абстрактное мышление, пространственное мышление и логическое суждение могут оставаться полностью сохранными. Системы рассуждений мозга и его языковые системы в значительной степени разделены. Язык, как оказывается, является в первую очередь интерфейсом коммуникации, а не субстратом самой мысли.
Почему непрерывное представление открывает новые возможности
Когда модель рассуждает в непрерывных латентных состояниях, а не в дискретных токенах, несколько возможностей становятся более естественными.
Глубина рассуждений больше не связана напрямую с длиной вывода. Модель может выполнять больше вычислений внутри себя перед выдачей ответа — без необходимости долгой видимой цепи промежуточных шагов. Глубина мышления не обязана быть пропорциональной тому, сколько модель пишет.
Модель также не привязана к единственному пути рассуждений в самый момент старта. Поскольку латентные состояния не требуют преждевременного выбора конкретного слова, становится проще удерживать альтернативные стратегии открытыми и пересматривать внутренние представления по мере поступления дополнительного контекста.
А абстрактные отношения — математические структуры, пространственные конфигурации, причинно-следственные зависимости — могут быть представлены напрямую в геометрии латентного пространства, вместо того чтобы приближаться к ним через ближайший доступный словарный запас.
Здесь в игру вступает HRM
HRM разработана для работы в латентном пространстве, позволяя рассуждениям разворачиваться внутренне до того, как они будут переведены на язык. Вместо того чтобы прогонять каждый шаг через слова, HRM работает в непрерывном пространстве представлений, где промежуточные состояния и возможные пути решения могут уточняться напрямую.
В этом смысле латентное пространство — не просто техническая концепция. Это основа для иного типа архитектуры ИИ: той, которая думает, прежде чем говорить.






