ИИ-агенты простыми словами: 3 уровня от ChatGPT до автономного агента

Объяснения про ИИ-агентов обычно бывают двух сортов: либо для программистов, либо для пятилетних. Эта статья — для тех, кто застрял посередине. Вы пользуетесь нейросетями каждый день, технического образования у вас нет, но разобраться, как всё устроено внутри, очень хочется.
Пойдём за три шага. Начнём с того, что вы и так знаете, — с ChatGPT. Потом разберём автоматизации. И только потом доберёмся до агентов. Без формул, на понятных примерах. И да — страшные слова вроде RAG и ReAct по дороге окажутся куда проще, чем выглядят.
Что вы узнаете
- Чем языковая модель отличается от автоматизации, а автоматизация — от ИИ-агента
- Почему ChatGPT не подскажет, когда у вас следующая встреча, и при чём тут две особенности всех нейросетей
- Что такое RAG и ReAct простыми словами
- Где проходит граница, за которой автоматизация превращается в агента
- Как это выглядит на простых примерах: от письма «на кофе» до расчёта по одному скриншоту
Главное. Уровней работы с ИИ всего три. Первый — языковые модели вроде ChatGPT и Claude: вы дали запрос, получили ответ, и на этом всё. Второй — автоматизации: цепочка шагов, которую собрал и держит под контролем человек. Третий — ИИ-агенты: ту же цепочку собирает и ведёт сама нейросеть. Вся разница третьего уровня в одном: решения принимает модель, а не вы.
Уровень 1. Языковые модели: вход и выход
Главное. ChatGPT, Claude, DeepSeek — это приложения поверх больших языковых моделей (LLM, Large Language Model). Они отлично пишут и правят текст: вы даёте запрос, модель возвращает ответ. Но у них есть два жёстких ограничения, и именно из-за них дальше понадобились автоматизации и агенты.
Схема работы простая. Есть вы. Вы вводите запрос — его ещё называют промптом. Модель выдаёт ответ, опираясь на тексты, на которых её обучали. Вход и выход, больше ничего.
Пример. Просим ChatGPT: «составь вежливое письмо с предложением встретиться на кофе, от которого нельзя отказаться». Текст просьбы — это вход. Готовое письмо, заметно вежливее, чем вышло бы у вас самих, — это выход.
Пока всё гладко. А теперь сломаем схему. Спросим у того же ChatGPT: «когда ближайшая встреча на кофе?» И тишина. Он не ответит, потому что доступа к вашему календарю и переписке у него попросту нет.
Отсюда две особенности всех языковых моделей. Запомните их — на них держится вообще всё дальнейшее:
- Модель не знает ваших данных. Сколько бы текстов в неё ни загрузили и какой бы доступ к интернету ни дали, ваши личные и рабочие данные она не видит. Пока вы сами их не покажете.
- Модель пассивна. Она ждёт запрос и только потом отвечает. По своей инициативе — ни шагу.
Уровень 2. Автоматизации: цепочка, которую собрал человек
Главное. Автоматизация (по-английски workflow, рабочий процесс) — это заданная человеком цепочка действий, где на отдельных шагах подключается ИИ. Модель получает доступ к вашим сервисам — календарю, погоде, документам — и перестаёт быть слепой. Но логику цепочки по-прежнему задаёте вы.
Усложним пример. Допустим, модели задали правило: «при каждом вопросе о событии сначала загляни в календарь и только потом отвечай».
Теперь на вопрос «когда ближайшая встреча с Дмитрием Ивановым?» модель сходит в календарь и спокойно ответит. Но спросите следом «а какая в тот день погода?» — и она снова споткнётся. Доступ к календарю вы дали, а к погоде — забыли. Откроете ей погодный сервис через API — получите нормальный ответ: на день встречи с Дмитрием Ивановым солнечно, временами облачно.
Вот это и есть суть автоматизации: цепочка шагов, которую задал человек. Сколько шагов ни добавляй, это всё ещё автоматизация — пока решения принимаете и логику выстраиваете вы.
При чём тут RAG
Первое «страшное» слово. RAG — это просто аббревиатура, за которой прячется одна мысль: у нейросети есть доступ к внешней базе данных или сервисам с информацией, и она туда заглядывает, чтобы дать точный ответ. В календарь, в погоду, в ваши документы, в приложения. Никакой магии — обычная часть всё той же автоматизации.
Как это выглядит на практике
Чаще всего такие цепочки собирают в сервисах вроде Make или n8n. Вот рабочий процесс для контент-маркетинга:
- Собираем ссылки на статьи в Google-таблицу.
- Через Perplexity делаем короткие пересказы.
- Отдельным промптом в GPT генерируем посты для Telegram или Дзена.
- Всё это запускается само, каждый день в 11:00.
Шаг, шаг, шаг — и всё собрано вашими руками. Пост вышел сухой, результат не нравится — вы идёте и правите промпт сами. То есть последнее слово всегда за человеком. Скучновато, если честно. На следующем уровне повеселее.
Третий уровень стоит на первом
Агент понимает цель ровно настолько, насколько внятно вы её описали, — всё держится на постановке задачи. Ей и учит курс по нейросетям для начинающих: первые 2 модуля открыты бесплатно, без карты.
Уровень 3. ИИ-агенты: цепочку ведёт сама нейросеть
Главное. Чтобы автоматизация стала агентом, достаточно убрать из цепочки человека и посадить на его место другую нейросеть. Агент сам придумывает, как собрать процесс, сам выбирает инструменты, сам смотрит на результат и переделывает, пока тот не устроит. Решает модель, а не вы.
Вернёмся к постам в Telegram. Когда вы делаете автоматизацию, вы сначала думаете как человек: какие статьи собрать, где взять ссылки, как их пересказать, какой промпт написать. А потом руками сшиваете шаги между собой. Сначала стратегия, затем ручная сборка связок.
И вот главная мысль всей статьи. Чтобы автоматизация превратилась в агента, нужно вынуть из цепочки человека и поставить на его место нейросеть.
Дальше агент делает ровно то же самое, но сам:
- Думает, как собрать процесс эффективнее и откуда тянуть данные.
- Действует — выбирает подходящий инструмент. Например, берёт Google-таблицу, а не Word.
- Улучшает результат по кругу. Видит, что одна модель пишет слабовато, — подменяет на другую, которая пишет живее. И крутит этот цикл, пока результат не дотянет до заданной планки.
При чём тут ReAct
Второе «страшное» слово — ReAct. Расшифровывается как Reason + Act, «рассуждай и действуй». Это и есть тот самый цикл агента: подумал, сделал шаг, посмотрел на результат, подумал снова. Ровно то, что мы описали выше. Звучит мудрёно, работает просто.
Пример посложнее: расчёт по скриншоту
Допустим, нужно посчитать среднее удержание пользователей в каком-нибудь боте. А дашборд показывает только частокол столбиков: каждый — это сколько людей осталось на такой-то день. В табличном виде данных нет. Есть лишь картинка.
Обычный ChatGPT за такое не возьмётся — попросит сначала прислать таблицу со всеми цифрами. Вот только будь эта таблица под рукой, задача бы и не стояла.
А ИИ-агент (например, Manus) справится сам:
- Набросает план решения из нескольких простых шагов.
- Вытащит данные прямо из картинки.
- Построит таблицу: дни и количество людей.
- Посчитает среднее удержание и приложит код расчёта.
- А под конец, чего никто не просил, оформит результат в виде аккуратного сайта.
Раньше такое считал бы человек вручную и неизвестно сколько времени. Теперь — агент. Под капотом всё, конечно, куда сложнее, но пользователю достаётся готовый результат, без погружения в технические дебри.
Три уровня рядом: в чём разница
Главное. Разница между уровнями — в том, кто принимает решения. На первом модель отвечает на запрос. На втором идёт по цепочке, которую проложил человек. На третьем сама выбирает стратегию, инструменты и доводит результат до ума.
| Уровень | Что это | Кто принимает решения | Пример |
|---|---|---|---|
| 1. Языковая модель | Вход → ответ | Человек на каждом запросе | Написали промпт — получили текст |
| 2. Автоматизация | Цепочка шагов, ИИ на отдельных этапах | Человек: задаёт логику и правит | Сбор ссылок → пересказ → пост по расписанию |
| 3. ИИ-агент | Та же цель, но цепочку ведёт нейросеть | Модель: сама выбирает путь и инструменты | «Посчитай удержание» — агент сам всё сделал |
На первом уровне вы пишете промпт и получаете ответ. На втором — выстраиваете цепочку, чтобы пройти заданный путь и решить задачу, подключая ИИ на нужных шагах. На третьем — просто описываете цель, может, отвечаете на пару уточняющих вопросов, а дальше нейросеть сама решает, какую стратегию выбрать, какие инструменты подключить, оценивает, что вышло, и при необходимости переделывает.
Первый уровень при этом никуда не исчезает: на нём всё держится на постановке задачи, и агенту вы описываете цель ровно теми же словами. Как это делать — в статье как написать промпт для ChatGPT.
Что запомнить
Три уровня — это не три разные технологии, а три ступени самостоятельности ИИ:
- Языковая модель знает только то, что вы ей дали, и ждёт запроса.
- Автоматизация добавляет доступ к вашим сервисам, но всю логику задаёт человек.
- ИИ-агент забирает у человека роль того, кто принимает решения, и ведёт задачу сам.
А страшные RAG и ReAct на поверку — всего лишь «доступ к внешним данным» и «думай и действуй». Уберите из рабочей цепочки человека, посадите на его место нейросеть — вот вам и агент.
Агенту вы объясняете цель теми же словами
Сколько уровней самостоятельности ни надстраивай сверху, внизу остаётся один навык: описать задачу так, чтобы её нельзя было понять двояко. Курс ПРОСТОПРОМТ про это — без кода, письменный формат, доступ навсегда. Первые 2 модуля — бесплатно.