Что такое OpenAI Agents SDK — его собственными словами
OpenAI описывает Agents SDK как способ «build agentic AI apps in a lightweight, easy-to-use package with very few abstractions» и как «a production-ready upgrade of our previous experimentation for agents, Swarm». Заявлен «a very small set of primitives»: Agents — «which are LLMs equipped with instructions and tools»; Handoffs — «which allow agents to delegate to other agents for specific tasks», названные «A powerful mechanism for coordinating and delegating work across multiple agents»; Guardrails — «which enable validation of agent inputs and outputs», выполняемые как проверки входа и безопасности «in parallel with agent execution»; Sessions — «a persistent memory layer for maintaining working context within an agent loop»; и встроенная трассировка, «that lets you visualize and debug your agentic flows». Принципы дизайна сформулированы прямо: «Enough features to be worth using, but few enough primitives to make it quick to learn» и «Works great out of the box, but you can customize exactly what happens». SDK Python-first — «Use built-in language features to orchestrate and chain agents, rather than needing to learn new abstractions», — использует «the Responses API by default for OpenAI models» и поддерживает сторонних провайдеров через адаптеры. (Источник: openai.github.io/openai-agents-python .)
Это важно, потому что версия этой страницы, которую можно было бы написать по полугодовалому ресёрчу — «у Forge есть handoffs и guardrails, а у SDK нет», — просто ложь. Есть и то и другое, названо теми же словами.
Разница в том, что эти слова означают в каждой из систем.
Разница одной таблицей
| OpenAI Agents SDK | Forge | |
|---|---|---|
| Что это | Небольшая Python-библиотека для агентских приложений | Работающая система, которая ведёт агентские команды |
| Что такое «handoff» | Один агент передаёт управление другому вызовом инструмента | Законченный результат работы именованной роли, который уходит дальше только после одобрения управляющим агентом |
| Кто судит о качестве | Вы: guardrails проверяют вход и выход, остальное решает вызывающий агент | Отдельный управляющий агент на каждом ребре: пропустить, вернуть с инструкциями на доработку или эскалировать человеку |
| Отклонённый шаг | Решает ваш код, обычно повторный промпт | Новый коммит; предыдущая попытка остаётся в истории, git diff показывает, что изменилось |
| След | Трассировка в инструментах OpenAI плюс память сессии | Ветка в вашем репозитории — спецификация, бриф и каждая передача коммитами, роль указана как Co-authored-by |
| Модели | Responses API по умолчанию для моделей OpenAI, остальные через адаптеры | Шлюз маршрутизации по пулу провайдеров с весами приоритета и автоматическим failover, включая self-hosted модели |
| Расписания, подтверждения, секреты, уведомления | Вы их пишете и эксплуатируете | Входят: cron-расписания, подтверждения в Telegram, скоупинг секретов, уведомления |
| Где выполняется | Там, где вы развернёте своё приложение | Управляемый SaaS или self-hosted раннеры на вашем железе |
| Область | Всё, что вы напишете | Разработка (самый зрелый архетип), а также ресёрч, контент и операции |
В чём Forge устроен иначе
Handoff — это артефакт, а не передача управления. Когда роль разработчика в Forge заканчивает, она производит передачу: структурированные поля плюс рассуждение прозой. Эту передачу читает управляющий агент, единственная задача которого — решить, достаточно ли она хороша для следующей роли. Слабая работа не уезжает по цепочке, чтобы тихо стать чужой проблемой. Делегирование двигает работу; проверка — это то, что не даёт двигаться плохой работе. Подробнее: Multi-Agent Pipeline .
Guardrails и валидатор отвечают на разные вопросы. «Безопасен ли этот вход» и «достаточно ли хорош этот дизайн, чтобы на нём строить» — не одна и та же проверка, и дешёвая из них только первая. Управляющий агент — это вызов модели, у которой перед глазами вся передача, и ему разрешено сказать «пока нет, вот чего не хватает» или «на это должен посмотреть человек».
След остаётся в вашем репозитории. Каждый прогон получает ветку со спецификацией, исходным брифом и передачей каждой роли в виде коммитов, где автором записана роль. Трассировка нужна, чтобы отладить поток, пока вы его пишете; ветка нужна, чтобы коллега через два квартала прочитал, почему архитектура пошла именно так, и сравнил вторую попытку с первой. Подробнее: Git-Backed Audit .
Вы описываете команду, а не собираете её. На входе фраза на обычном языке; Forge предлагает роли, переходы и валидатора и ждёт одобрения, прежде чем что-то потратить. Подробнее: Workflow Engine .
Окружающая система уже существует. Расписания, подтверждения и запуск через Telegram , скоупинг секретов и контроль egress , уведомления , self-hosted раннеры и маршрутизация провайдеров с failover. Ничто из этого не трудно написать один раз; всё это утомительно эксплуатировать всегда.
Число, которое один агент показать не может
Guardrails показывают, как часто вход или выход были заблокированы. Это другой вопрос по сравнению с тем, как часто законченную работу признавали недостаточно хорошей, чтобы пропустить дальше, — а именно второй вопрос решает, уедет ли проект не туда.
| Двенадцать недель, за которые Forge собирал Forge | |
|---|---|
| Запущено прогонов | 322 |
| Передач оценено управляющим агентом | 1216 |
| Возвращено автору на доработку | 56 |
| Эскалировано человеку | 24 |
| Прогонов, где руководитель остановил хотя бы одну передачу | 51 |
| Прогонов завершилось успешно | 215 |
| Прогонов упало, эскалировано или отменено | 103 |
| Медианное время от запуска до конца прогона | 39 минут |
| Медианное число передач на успешный прогон | 5 |
| Влитых pull request в 7 репозиториях | 202 |
Откуда это взято. Один процесс — Main Forge SDLC, тот самый, который собирает Forge, — все его прогоны за двенадцать недель подряд, посчитанные по собственным записям управляющего контура. Не выборка, не пилот и не клиентский кейс, который мы не можем показать.
Forge останавливал собственную работу 80 раз. 56 передач вернулись автору с конкретными инструкциями на доработку, 24 ушли к человеку. Один прогон из шести прервал его собственный руководитель раньше, чем на работу посмотрел человек. Это ровно та проверка, которую инструмент с одним агентом оставляет вам, — здесь она стоит один вызов модели на ребро и посчитана.
За тот же период влито 202 pull request в 7 репозиториях — примерно 17 в неделю, в ту самую платформу, о которой вы читаете, причём каждое слияние делал человек. По всей организации работа, написанная агентами, влилась в 773 случаях из 875 открытых. Forge — не демо, работающее рядом с продуктом; это способ, которым продукт собирается, и это его коммиты.
Успешный прогон занимает примерно 39 минут и 5 передач. Медиана от запуска до завершения — и внутри этих 39 минут лежат проверки, которые не дали 80 результатам работы доехать до следующей роли в том виде, в каком они были написаны.
1216 суждений о законченных результатах работы, 80 из них отрицательные. Guardrail не смог бы дать эту таблицу: он смотрит на входы и выходы с точки зрения безопасности, а здесь спрашивали, достаточно ли хороша архитектура, чтобы разработчик на ней строил.
Попросите провести вас по самим прогонам — ветка, коммиты передач, вердикты, которые вернули работу назад, и те, что ушли к человеку. Любое другое число на этом сайте относится к конкретному прогону и так и подписано: 18 собранных источников, 11 проверенных прямым обращением, 4 подтверждённых перекрёстно и 2 помеченных как непроверяемые — на странице сценария .
Источники
- openai.github.io/openai-agents-python — примитивы, handoffs, guardrails, сессии, трассировка, принципы дизайна, позиция по провайдерам.
- Утверждения о Forge на этой странице ведут на соответствующие страницы возможностей , где механика описана подробно.