Главная сложность в разработке инструментов с ИИ в том, что LLM по своей природе вероятностны. Задайте один и тот же вопрос дважды — и получите два разных ответа. Для чат-бота это нормально. Для конвейера, который выдаёт продакшен-код, — нет.
Поэтому мы сделали LLMOS — операционную систему для LLM.
В чём проблема
Обычные инструменты разработки с ИИ считают каждое обращение независимым. Нет гарантированного состояния, нет воспроизводимости, нет способа разобраться, что пошло не так, когда агент выдал что-то неожиданное. На руках только лог чата и пожатие плечами.
Чтобы мультиагентный конвейер Forge работал надёжно, нам понадобилась принципиально другая модель исполнения.
Машины состояний на событиях
LLMOS считает каждый ход агента неизменяемым событием в журнале, куда можно только дописывать. Состояние конвейера целиком выводится из повторного проигрывания этих событий. Отсюда:
- Полная воспроизводимость. На одних и тех же событиях состояние всегда получается одно и то же.
- Аудиторский след. Записано каждое решение, каждое изменение контекста, каждый вызов инструмента.
- Ветвление. Конвейер можно форкнуть в любой точке и попробовать другой путь.
- Отладка с перемоткой назад. Идите по конвейеру в обратную сторону и найдите ровно то место, где всё поехало.
Сжатие контекста
Длинные конвейеры упираются в границы контекстного окна. LLMOS реализует многослойную память:
- L0 — сырые события. Каждый токен, каждый вызов инструмента — и всё это неизменяемо.
- L1 — активный контекст. То, что агент видит прямо сейчас, в пределах бюджета токенов.
- L2 — структурированное состояние. Извлечённые факты, решения и инварианты.
- L3 — векторный индекс. Семантический поиск по всей истории сессии.
Сжатие контекста — это не пересказ с потерями, а структурированное извлечение, которое сохраняет то, что важно для текущей задачи агента.
Детерминированный контроль
Ключевое наблюдение: отдельные вызовы LLM вероятностны, но оркестрация вокруг них может быть детерминированной. LLMOS даёт:
- правила автоматизации, управляемые политиками;
- явное управление бюджетом токенов;
- контролируемые стратегии сжатия;
- воспроизводимые пути исполнения.
В итоге получается система, результату которой можно доверять, — потому что каждый шаг, который к нему привёл, можно посмотреть, проиграть заново и проверить.
LLMOS — тот фундамент, на котором мультиагентный конвейер Forge держится надёжно. Технические детали будем разбирать в следующих постах.