ИИ-агенты простыми словами: 3 уровня от ChatGPT до автономного агента

Объяснения про ИИ-агентов обычно бывают двух сортов: либо для программистов, либо для пятилетних. Эта статья — для тех, кто застрял посередине. Вы пользуетесь нейросетями каждый день, технического образования у вас нет, но разобраться, как всё устроено внутри, очень хочется.
Пойдём за три шага. Начнём с того, что вы и так знаете, — с ChatGPT. Потом разберём автоматизации. И только потом доберёмся до агентов. Без формул, на понятных примерах. И да — страшные слова вроде RAG и ReAct по дороге окажутся куда проще, чем выглядят.
Что вы узнаете
- Чем языковая модель отличается от автоматизации, а автоматизация — от ИИ-агента
- Почему ChatGPT не подскажет, когда у вас следующая встреча, и при чём тут две особенности всех нейросетей
- Что такое RAG и ReAct простыми словами
- Где проходит граница, за которой автоматизация превращается в агента
- Как это выглядит на простых примерах: от письма «на кофе» до расчёта по одному скриншоту
Главное. Уровней работы с ИИ всего три. Первый — языковые модели вроде ChatGPT и Claude: вы дали запрос, получили ответ, и на этом всё. Второй — автоматизации: цепочка шагов, которую собрал и держит под контролем человек. Третий — ИИ-агенты: ту же цепочку собирает и ведёт сама нейросеть. Вся разница третьего уровня в одном: решения принимает модель, а не вы.
Уровень 1. Языковые модели: вход и выход
Главное. ChatGPT, Claude, DeepSeek — это приложения поверх больших языковых моделей (LLM, Large Language Model). Они отлично пишут и правят текст: вы даёте запрос, модель возвращает ответ. Но у них есть два жёстких ограничения, и именно из-за них дальше понадобились автоматизации и агенты.
Схема работы простая. Есть вы. Вы вводите запрос — его ещё называют промптом. Модель выдаёт ответ, опираясь на тексты, на которых её обучали. Вход и выход, больше ничего.
Пример. Просим ChatGPT: «составь вежливое письмо с предложением встретиться на кофе, от которого нельзя отказаться». Текст просьбы — это вход. Готовое письмо, заметно вежливее, чем вышло бы у вас самих, — это выход.
Пока всё гладко. А теперь сломаем схему. Спросим у того же ChatGPT: «когда ближайшая встреча на кофе?» И тишина. Он не ответит, потому что доступа к вашему календарю и переписке у него попросту нет.
Отсюда две особенности всех языковых моделей. Запомните их — на них держится вообще всё дальнейшее:
- Модель не знает ваших данных. Сколько бы текстов в неё ни загрузили и какой бы доступ к интернету ни дали, ваши личные и рабочие данные она не видит. Пока вы сами их не покажете.
- Модель пассивна. Она ждёт запрос и только потом отвечает. По своей инициативе — ни шагу.
Уровень 2. Автоматизации: цепочка, которую собрал человек
Главное. Автоматизация (по-английски workflow, рабочий процесс) — это заданная человеком цепочка действий, где на отдельных шагах подключается ИИ. Модель получает доступ к вашим сервисам — календарю, погоде, документам — и перестаёт быть слепой. Но логику цепочки по-прежнему задаёте вы.
Усложним пример. Допустим, модели задали правило: «при каждом вопросе о событии сначала загляни в календарь и только потом отвечай».
Теперь на вопрос «когда ближайшая встреча с Дмитрием Ивановым?» модель сходит в календарь и спокойно ответит. Но спросите следом «а какая в тот день погода?» — и она снова споткнётся. Доступ к календарю вы дали, а к погоде — забыли. Откроете ей погодный сервис через API — получите нормальный ответ: на день встречи с Дмитрием Ивановым солнечно, временами облачно.
Вот это и есть суть автоматизации: цепочка шагов, которую задал человек. Сколько шагов ни добавляй, это всё ещё автоматизация — пока решения принимаете и логику выстраиваете вы.
При чём тут RAG
Первое «страшное» слово. RAG — это просто аббревиатура, за которой прячется одна мысль: у нейросети есть доступ к внешней базе данных или сервисам с информацией, и она туда заглядывает, чтобы дать точный ответ. В календарь, в погоду, в ваши документы, в приложения. Никакой магии — обычная часть всё той же автоматизации.
Как это выглядит на практике
Чаще всего такие цепочки собирают в сервисах вроде Make или n8n. Вот рабочий процесс для контент-маркетинга:
- Собираем ссылки на статьи в Google-таблицу.
- Через Perplexity делаем короткие пересказы.
- Отдельным промптом в GPT генерируем посты для Telegram или Дзена.
- Всё это запускается само, каждый день в 11:00.
Шаг, шаг, шаг — и всё собрано вашими руками. Пост вышел сухой, результат не нравится — вы идёте и правите промпт сами. То есть последнее слово всегда за человеком. Скучновато, если честно. На следующем уровне повеселее.
Уровень 3. ИИ-агенты: цепочку ведёт сама нейросеть
Главное. Чтобы автоматизация стала агентом, достаточно убрать из цепочки человека и посадить на его место другую нейросеть. Агент сам придумывает, как собрать процесс, сам выбирает инструменты, сам смотрит на результат и переделывает, пока тот не устроит. Решает модель, а не вы.
Вернёмся к постам в Telegram. Когда вы делаете автоматизацию, вы сначала думаете как человек: какие статьи собрать, где взять ссылки, как их пересказать, какой промпт написать. А потом руками сшиваете шаги между собой. Сначала стратегия, затем ручная сборка связок.
И вот главная мысль всей статьи. Чтобы автоматизация превратилась в агента, нужно вынуть из цепочки человека и поставить на его место нейросеть.
Дальше агент делает ровно то же самое, но сам:
- Думает, как собрать процесс эффективнее и откуда тянуть данные.
- Действует — выбирает подходящий инструмент. Например, берёт Google-таблицу, а не Word.
- Улучшает результат по кругу. Видит, что одна модель пишет слабовато, — подменяет на другую, которая пишет живее. И крутит этот цикл, пока результат не дотянет до заданной планки.
При чём тут ReAct
Второе «страшное» слово — ReAct. Расшифровывается как Reason + Act, «рассуждай и действуй». Это и есть тот самый цикл агента: подумал, сделал шаг, посмотрел на результат, подумал снова. Ровно то, что мы описали выше. Звучит мудрёно, работает просто.
Пример посложнее: расчёт по скриншоту
Допустим, нужно посчитать среднее удержание пользователей в каком-нибудь боте. А дашборд показывает только частокол столбиков: каждый — это сколько людей осталось на такой-то день. В табличном виде данных нет. Есть лишь картинка.
Обычный ChatGPT за такое не возьмётся — попросит сначала прислать таблицу со всеми цифрами. Вот только будь эта таблица под рукой, задача бы и не стояла.
А ИИ-агент (например, Manus) справится сам:
- Набросает план решения из нескольких простых шагов.
- Вытащит данные прямо из картинки.
- Построит таблицу: дни и количество людей.
- Посчитает среднее удержание и приложит код расчёта.
- А под конец, чего никто не просил, оформит результат в виде аккуратного сайта.
Раньше такое считал бы человек вручную и неизвестно сколько времени. Теперь — агент. Под капотом всё, конечно, куда сложнее, но пользователю достаётся готовый результат, без погружения в технические дебри.
Три уровня рядом: в чём разница
Главное. Разница между уровнями — в том, кто принимает решения. На первом модель отвечает на запрос. На втором идёт по цепочке, которую проложил человек. На третьем сама выбирает стратегию, инструменты и доводит результат до ума.
| Уровень | Что это | Кто принимает решения | Пример |
|---|---|---|---|
| 1. Языковая модель | Вход → ответ | Человек на каждом запросе | Написали промпт — получили текст |
| 2. Автоматизация | Цепочка шагов, ИИ на отдельных этапах | Человек: задаёт логику и правит | Сбор ссылок → пересказ → пост по расписанию |
| 3. ИИ-агент | Та же цель, но цепочку ведёт нейросеть | Модель: сама выбирает путь и инструменты | «Посчитай удержание» — агент сам всё сделал |
На первом уровне вы пишете промпт и получаете ответ. На втором — выстраиваете цепочку, чтобы пройти заданный путь и решить задачу, подключая ИИ на нужных шагах. На третьем — просто описываете цель, может, отвечаете на пару уточняющих вопросов, а дальше нейросеть сама решает, какую стратегию выбрать, какие инструменты подключить, оценивает, что вышло, и при необходимости переделывает.
Что запомнить
Три уровня — это не три разные технологии, а три ступени самостоятельности ИИ:
- Языковая модель знает только то, что вы ей дали, и ждёт запроса.
- Автоматизация добавляет доступ к вашим сервисам, но всю логику задаёт человек.
- ИИ-агент забирает у человека роль того, кто принимает решения, и ведёт задачу сам.
А страшные RAG и ReAct на поверку — всего лишь «доступ к внешним данным» и «думай и действуй». Уберите из рабочей цепочки человека, посадите на его место нейросеть — вот вам и агент.