ИИ-агенты простыми словами: 3 уровня от ChatGPT до автономного агента

ИИ-агенты простыми словами: 3 уровня от ChatGPT до автономного агента

Объяснения про ИИ-агентов обычно бывают двух сортов: либо для программистов, либо для пятилетних. Эта статья — для тех, кто застрял посередине. Вы пользуетесь нейросетями каждый день, технического образования у вас нет, но разобраться, как всё устроено внутри, очень хочется.

Пойдём за три шага. Начнём с того, что вы и так знаете, — с ChatGPT. Потом разберём автоматизации. И только потом доберёмся до агентов. Без формул, на понятных примерах. И да — страшные слова вроде RAG и ReAct по дороге окажутся куда проще, чем выглядят.

Что вы узнаете

  • Чем языковая модель отличается от автоматизации, а автоматизация — от ИИ-агента
  • Почему ChatGPT не подскажет, когда у вас следующая встреча, и при чём тут две особенности всех нейросетей
  • Что такое RAG и ReAct простыми словами
  • Где проходит граница, за которой автоматизация превращается в агента
  • Как это выглядит на простых примерах: от письма «на кофе» до расчёта по одному скриншоту

Главное. Уровней работы с ИИ всего три. Первый — языковые модели вроде ChatGPT и Claude: вы дали запрос, получили ответ, и на этом всё. Второй — автоматизации: цепочка шагов, которую собрал и держит под контролем человек. Третий — ИИ-агенты: ту же цепочку собирает и ведёт сама нейросеть. Вся разница третьего уровня в одном: решения принимает модель, а не вы.

Уровень 1. Языковые модели: вход и выход

Главное. ChatGPT, Claude, DeepSeek — это приложения поверх больших языковых моделей (LLM, Large Language Model). Они отлично пишут и правят текст: вы даёте запрос, модель возвращает ответ. Но у них есть два жёстких ограничения, и именно из-за них дальше понадобились автоматизации и агенты.

Схема работы простая. Есть вы. Вы вводите запрос — его ещё называют промптом. Модель выдаёт ответ, опираясь на тексты, на которых её обучали. Вход и выход, больше ничего.

Пример. Просим ChatGPT: «составь вежливое письмо с предложением встретиться на кофе, от которого нельзя отказаться». Текст просьбы — это вход. Готовое письмо, заметно вежливее, чем вышло бы у вас самих, — это выход.

Пока всё гладко. А теперь сломаем схему. Спросим у того же ChatGPT: «когда ближайшая встреча на кофе?» И тишина. Он не ответит, потому что доступа к вашему календарю и переписке у него попросту нет.

Отсюда две особенности всех языковых моделей. Запомните их — на них держится вообще всё дальнейшее:

  1. Модель не знает ваших данных. Сколько бы текстов в неё ни загрузили и какой бы доступ к интернету ни дали, ваши личные и рабочие данные она не видит. Пока вы сами их не покажете.
  2. Модель пассивна. Она ждёт запрос и только потом отвечает. По своей инициативе — ни шагу.

Уровень 2. Автоматизации: цепочка, которую собрал человек

Главное. Автоматизация (по-английски workflow, рабочий процесс) — это заданная человеком цепочка действий, где на отдельных шагах подключается ИИ. Модель получает доступ к вашим сервисам — календарю, погоде, документам — и перестаёт быть слепой. Но логику цепочки по-прежнему задаёте вы.

Усложним пример. Допустим, модели задали правило: «при каждом вопросе о событии сначала загляни в календарь и только потом отвечай».

Теперь на вопрос «когда ближайшая встреча с Дмитрием Ивановым?» модель сходит в календарь и спокойно ответит. Но спросите следом «а какая в тот день погода?» — и она снова споткнётся. Доступ к календарю вы дали, а к погоде — забыли. Откроете ей погодный сервис через API — получите нормальный ответ: на день встречи с Дмитрием Ивановым солнечно, временами облачно.

Вот это и есть суть автоматизации: цепочка шагов, которую задал человек. Сколько шагов ни добавляй, это всё ещё автоматизация — пока решения принимаете и логику выстраиваете вы.

При чём тут RAG

Первое «страшное» слово. RAG — это просто аббревиатура, за которой прячется одна мысль: у нейросети есть доступ к внешней базе данных или сервисам с информацией, и она туда заглядывает, чтобы дать точный ответ. В календарь, в погоду, в ваши документы, в приложения. Никакой магии — обычная часть всё той же автоматизации.

Как это выглядит на практике

Чаще всего такие цепочки собирают в сервисах вроде Make или n8n. Вот рабочий процесс для контент-маркетинга:

  1. Собираем ссылки на статьи в Google-таблицу.
  2. Через Perplexity делаем короткие пересказы.
  3. Отдельным промптом в GPT генерируем посты для Telegram или Дзена.
  4. Всё это запускается само, каждый день в 11:00.

Шаг, шаг, шаг — и всё собрано вашими руками. Пост вышел сухой, результат не нравится — вы идёте и правите промпт сами. То есть последнее слово всегда за человеком. Скучновато, если честно. На следующем уровне повеселее.

Уровень 3. ИИ-агенты: цепочку ведёт сама нейросеть

Главное. Чтобы автоматизация стала агентом, достаточно убрать из цепочки человека и посадить на его место другую нейросеть. Агент сам придумывает, как собрать процесс, сам выбирает инструменты, сам смотрит на результат и переделывает, пока тот не устроит. Решает модель, а не вы.

Вернёмся к постам в Telegram. Когда вы делаете автоматизацию, вы сначала думаете как человек: какие статьи собрать, где взять ссылки, как их пересказать, какой промпт написать. А потом руками сшиваете шаги между собой. Сначала стратегия, затем ручная сборка связок.

И вот главная мысль всей статьи. Чтобы автоматизация превратилась в агента, нужно вынуть из цепочки человека и поставить на его место нейросеть.

Дальше агент делает ровно то же самое, но сам:

  • Думает, как собрать процесс эффективнее и откуда тянуть данные.
  • Действует — выбирает подходящий инструмент. Например, берёт Google-таблицу, а не Word.
  • Улучшает результат по кругу. Видит, что одна модель пишет слабовато, — подменяет на другую, которая пишет живее. И крутит этот цикл, пока результат не дотянет до заданной планки.

При чём тут ReAct

Второе «страшное» слово — ReAct. Расшифровывается как Reason + Act, «рассуждай и действуй». Это и есть тот самый цикл агента: подумал, сделал шаг, посмотрел на результат, подумал снова. Ровно то, что мы описали выше. Звучит мудрёно, работает просто.

Пример посложнее: расчёт по скриншоту

Допустим, нужно посчитать среднее удержание пользователей в каком-нибудь боте. А дашборд показывает только частокол столбиков: каждый — это сколько людей осталось на такой-то день. В табличном виде данных нет. Есть лишь картинка.

Обычный ChatGPT за такое не возьмётся — попросит сначала прислать таблицу со всеми цифрами. Вот только будь эта таблица под рукой, задача бы и не стояла.

А ИИ-агент (например, Manus) справится сам:

  1. Набросает план решения из нескольких простых шагов.
  2. Вытащит данные прямо из картинки.
  3. Построит таблицу: дни и количество людей.
  4. Посчитает среднее удержание и приложит код расчёта.
  5. А под конец, чего никто не просил, оформит результат в виде аккуратного сайта.

Раньше такое считал бы человек вручную и неизвестно сколько времени. Теперь — агент. Под капотом всё, конечно, куда сложнее, но пользователю достаётся готовый результат, без погружения в технические дебри.

Три уровня рядом: в чём разница

Главное. Разница между уровнями — в том, кто принимает решения. На первом модель отвечает на запрос. На втором идёт по цепочке, которую проложил человек. На третьем сама выбирает стратегию, инструменты и доводит результат до ума.

Уровень Что это Кто принимает решения Пример
1. Языковая модель Вход → ответ Человек на каждом запросе Написали промпт — получили текст
2. Автоматизация Цепочка шагов, ИИ на отдельных этапах Человек: задаёт логику и правит Сбор ссылок → пересказ → пост по расписанию
3. ИИ-агент Та же цель, но цепочку ведёт нейросеть Модель: сама выбирает путь и инструменты «Посчитай удержание» — агент сам всё сделал

На первом уровне вы пишете промпт и получаете ответ. На втором — выстраиваете цепочку, чтобы пройти заданный путь и решить задачу, подключая ИИ на нужных шагах. На третьем — просто описываете цель, может, отвечаете на пару уточняющих вопросов, а дальше нейросеть сама решает, какую стратегию выбрать, какие инструменты подключить, оценивает, что вышло, и при необходимости переделывает.

Что запомнить

Три уровня — это не три разные технологии, а три ступени самостоятельности ИИ:

  • Языковая модель знает только то, что вы ей дали, и ждёт запроса.
  • Автоматизация добавляет доступ к вашим сервисам, но всю логику задаёт человек.
  • ИИ-агент забирает у человека роль того, кто принимает решения, и ведёт задачу сам.

А страшные RAG и ReAct на поверку — всего лишь «доступ к внешним данным» и «думай и действуй». Уберите из рабочей цепочки человека, посадите на его место нейросеть — вот вам и агент.