Все статьи
llmos ai-orchestration architecture 2 мин чтения

LLMOS: детерминированная оркестрация вероятностного ИИ

Как наша операционная система для LLM даёт детерминированный контроль над процессами с ИИ: машины состояний на событиях, сжатие контекста и отладка с перемоткой назад.

автор Vitaly Nikitin

Главная сложность в разработке инструментов с ИИ в том, что LLM по своей природе вероятностны. Задайте один и тот же вопрос дважды — и получите два разных ответа. Для чат-бота это нормально. Для конвейера, который выдаёт продакшен-код, — нет.

Поэтому мы сделали LLMOS — операционную систему для LLM.

В чём проблема

Обычные инструменты разработки с ИИ считают каждое обращение независимым. Нет гарантированного состояния, нет воспроизводимости, нет способа разобраться, что пошло не так, когда агент выдал что-то неожиданное. На руках только лог чата и пожатие плечами.

Чтобы мультиагентный конвейер Forge работал надёжно, нам понадобилась принципиально другая модель исполнения.

Машины состояний на событиях

LLMOS считает каждый ход агента неизменяемым событием в журнале, куда можно только дописывать. Состояние конвейера целиком выводится из повторного проигрывания этих событий. Отсюда:

  • Полная воспроизводимость. На одних и тех же событиях состояние всегда получается одно и то же.
  • Аудиторский след. Записано каждое решение, каждое изменение контекста, каждый вызов инструмента.
  • Ветвление. Конвейер можно форкнуть в любой точке и попробовать другой путь.
  • Отладка с перемоткой назад. Идите по конвейеру в обратную сторону и найдите ровно то место, где всё поехало.

Сжатие контекста

Длинные конвейеры упираются в границы контекстного окна. LLMOS реализует многослойную память:

  • L0 — сырые события. Каждый токен, каждый вызов инструмента — и всё это неизменяемо.
  • L1 — активный контекст. То, что агент видит прямо сейчас, в пределах бюджета токенов.
  • L2 — структурированное состояние. Извлечённые факты, решения и инварианты.
  • L3 — векторный индекс. Семантический поиск по всей истории сессии.

Сжатие контекста — это не пересказ с потерями, а структурированное извлечение, которое сохраняет то, что важно для текущей задачи агента.

Детерминированный контроль

Ключевое наблюдение: отдельные вызовы LLM вероятностны, но оркестрация вокруг них может быть детерминированной. LLMOS даёт:

  • правила автоматизации, управляемые политиками;
  • явное управление бюджетом токенов;
  • контролируемые стратегии сжатия;
  • воспроизводимые пути исполнения.

В итоге получается система, результату которой можно доверять, — потому что каждый шаг, который к нему привёл, можно посмотреть, проиграть заново и проверить.

LLMOS — тот фундамент, на котором мультиагентный конвейер Forge держится надёжно. Технические детали будем разбирать в следующих постах.