AI-агенты
AI-агент во FlutterFlow — это настроенный вами вызов модели: вы описываете его в билдере, а из приложения дёргаете действием. Так в приложение добавляются чат, генерация изображений и видео, синтез и распознавание речи.
Агенты работают с моделями OpenAI, Google, Anthropic и ElevenLabs. От выбранного вида агента зависит, что он умеет: вести диалог, озвучивать текст, расшифровывать аудио, рисовать картинки по описанию или собирать короткие видео.
Примеры:
- Стилист. В приложении для покупки одежды агент разбирает фотографии вещей из гардероба и подсказывает сочетания по цвету, стилю и сезону.
- Помощник на кухне. Предлагает рецепты из имеющихся продуктов с учётом ограничений в питании и ведёт пользователя по шагам.
- Генератор картинок для маркетинга. Делает обложки товаров, посты для соцсетей и баннеры кампаний по текстовому описанию.
- Приложение для изучения языка. Синтез речи читает фразы вслух — слышно, как они звучат.
- Заметки со встреч. Распознавание речи превращает записи и голосовые заметки в текст, по которому можно искать.
- Промо-ролики. Генерация видео собирает короткие клипы для анонсов и рекламы.
- Пройдено подключение Firebase. Особое внимание — пунктам 5 и 8 в разделе Выдайте FlutterFlow доступ к проекту: пользователю firebase@flutterflow.io нужна роль Cloud Functions Admin.
- Проект Firebase переведён на тариф Blaze — запросы к моделям идут через облачные функции.
- Есть ключ API нужного провайдера: OpenAI, Anthropic, Google AI Studio или ElevenLabs.
Создание агента
Откройте вкладку Agents в меню слева и нажмите (+). Задайте понятное Agent Name — например, ShoppingAssistant — и нажмите Create.
На тарифе Basic доступен один агент, на Growth и выше — сколько угодно.
Дальше — общие настройки:
- Agent Kind — что агент делает: Chat, Image Generation, Text-to-Speech, Speech-to-Text или Video Generation.
- Internal Description — короткая заметка для вас; модели она не передаётся.
Вид агента определяет и набор настроек, и то, каким действием его вызывать: агент Chat работает с действием Send Message, агент Image Generation — с Generate Image.
Chat
Агент вида Chat ведёт диалог: отвечает текстом, разметкой markdown или структурированным JSON. На нём строят поддержку, обучающих ассистентов, подборщиков товаров и разборщиков присланных пользователем текстов, картинок, PDF, аудио и видео.
System Message
Задаёт роль и манеру ответов. Строка вроде «You are an AI fashion stylist…» заставляет агента отвечать как стилист — про образы, цвета и сочетания.
Preloaded Messages
Заранее заданные реплики показывают агенту, в каком виде отвечать.
- Role — от кого сообщение: User или Assistant.
- Message — текст реплики.
- Пример:
- User: «Что надеть в солнечный день при среднем тоне кожи?»
- Assistant: «Пастельный верх и белые чиносы. Добавьте солнцезащитные очки и удобную обувь».
Задайте хотя бы одну пару «вопрос — ответ»: так агент точнее попадает в нужный формат.
Model Settings
- Provider — поставщик модели: OpenAI, Google или Anthropic.
- OpenAI и Anthropic. FlutterFlow создаст в Firebase облачную функцию, которая передаёт запросы в API. Поэтому проект Firebase должен быть на платном тарифе Blaze. Функция доступна только авторизованным пользователям.
- Google. В проекте Firebase нужно включить:
- Firebase Authentication — для безопасного обмена с агентом;
- Vertex AI — платформу Google для моделей; FlutterFlow использует пакет
firebase_vertexai.
- Model — конкретная модель выбранного провайдера. Модели отличаются возможностями, набором параметров и ценой.
- API Key — ключ провайдера, если он нужен. FlutterFlow хранит его внутри облачной функции: в приложение и в сетевые запросы ключ не попадает.
Request Options
Что пользователь может отправить агенту:
- Text — текст: вопросы, описания, запросы.
- Image — фотографии для разбора: предметы, стили, обстановка.
- PDF (только Anthropic и Google) — документы: резюме, отчёты, анкеты.
- Audio (только Google) — записи голоса: расшифровка, тон сообщения, голосовые команды.
- Video (только Google) — видеофайлы для разбора.
Несколько типов ввода сразу упрощают жизнь пользователю: в том же стилисте с включёнными Text и Image он может либо описать вещь словами, либо просто прислать фото.
Response Options
В каком виде агент отвечает:
- Text — обычный текст.
- Markdown — с заголовками, списками и ссылками, если вы выводите ответ как markdown. Полезно для справочного бота.
- JSON — структурированные данные, которые можно разобрать в коде:
{ name: 'Pizza Palace', distance: '2.4 miles' }— и сразу на карту.
Model Parameters
- Temperature — насколько ответы предсказуемы, от 0 до 1. Ниже (0.1) — суше и стабильнее; выше (1.0) — разнообразнее, годится для генерации идей.
- Max Tokens — предел на запрос и ответ вместе. Ограничивает расходы и длину ответов.
- Top P — ещё один способ управлять разнообразием слов. Обычно оставляют по умолчанию.
Например, помощнику по написанию текстов ставят температуру повыше и щедрый лимит токенов, а финансовому боту — низкую температуру: там нужна одинаковость, а не фантазия.
Send Message [Действие]
Действие передаёт агенту ввод пользователя — текст, картинку — и возвращает ответ. Обычно его вешают на кнопку «Отправить» рядом с полем ввода.
- Select Agent — какой агент отвечает.
- Conversation ID — идентификатор диалога. Одинаковый ID (например,
user123_AIStylist_202503181200) сохраняет контекст между сообщениями, и разговор остаётся связным. - Text Input — сообщение пользователя, обычно из Widget State поля ввода.
- Image Input — картинка, если агент её принимает.
- Audio Input — аудиофайл, если агент его принимает.
- Video Input — видеофайл, если агент его принимает.
- Медиафайлы передают либо ссылкой, либо файлом с устройства.
- Агенты не от Google пока принимают только ссылки. Чтобы отправить файл с устройства, сначала загрузите его в хранилище и передайте полученную ссылку.
- Action Output Variable Name — переменная с ответом агента: её выводят пользователю или обрабатывают дальше.

Clear Chat History [Действие]
Действие сбрасывает контекст диалога: принимает Conversation ID и перестаёт ссылаться на прежнюю ветку при следующем сообщении.

Синтез речи
Агент Text-to-Speech озвучивает текст: читает сообщения вслух, наговаривает дикторский текст, делает озвучку.
Настройки:
- Provider — поставщик синтеза, например ElevenLabs.
- Model — модель синтеза, например Eleven Flash v2.5.
- API Key — ключ провайдера для облачной функции.
- Voice ID — голос по умолчанию; в действии его можно переопределить.
- Output Format — формат аудио, например MP3.
- Stability — насколько ровно звучит голос.
- Similarity Boost — насколько результат держится выбранного голоса.
- Speed — темп речи.

Generate Speech [Действие]
Действие отправляет текст агенту синтеза и получает аудио.
- Select TTS Agent — какой агент озвучивает.
- Text Input — текст для озвучки.
- Voice ID Override — другой голос только для этого вызова, необязательно.
- Action Output Variable Name — переменная с готовым аудио.

Распознавание речи
Агент Speech-to-Text превращает аудио в текст: голосовые заметки, записи встреч, обращения в поддержку, файлы по ссылке.
Настройки:
- Provider — поставщик распознавания, например ElevenLabs.
- Model — модель, например Scribe v2.
- API Key — ключ провайдера для облачной функции.

Transcribe Audio [Действие]
Действие отправляет аудио агенту и возвращает расшифровку.
- Select STT Agent — какой агент расшифровывает.
- Audio Source — откуда взять запись: Audio URL или Uploaded Audio File.
- Language Code — код языка, например
en, необязательно. - Action Output Variable Name — переменная с расшифрованным текстом.

Генерация изображений
Агент Image Generation рисует картинку по описанию — обложки товаров, аватары, фоны, баннеры кампаний.
Настройки:
- Provider — поставщик: Google или OpenAI.
- Model — модель генерации: Gemini или GPT Image.
- API Key — ключ провайдера для облачной функции.
- Image Size — размер по умолчанию; в действии его можно переопределить.

Generate Image [Действие]
- Select Image Generation Agent — какой агент рисует.
- Prompt — описание нужной картинки.
- Size Override — размер только для этого вызова: Use Agent Default либо Square (1024 × 1024), Portrait (1024 × 1536), Landscape (1536 × 1024).
- Action Output Variable Name — переменная с готовым изображением.

Генерация видео
Агент Video Generation собирает видео по описанию: короткие клипы, анонсы, раскадровки, ролики для соцсетей.
Настройки:
- Provider — поставщик, например Google.
- Model — модель, например Veo 3.1.
- API Key — ключ провайдера для облачной функции.
- Aspect Ratio — соотношение сторон по умолчанию; в действии его можно переопределить.
- Duration — желаемая длительность.

Генерация видео занимает от 30 секунд до нескольких минут. Всё это время облачная функция держит соединение открытым.
Generate Video [Действие]
- Select Video Generation Agent — какой агент собирает видео.
- Prompt — описание ролика.
- Aspect Ratio Override — соотношение сторон только для этого вызова: Use Agent Default либо Landscape (16:9), Portrait (9:16), Square (1:1).
- Action Output Variable Name — переменная с готовым видео.

Параметры развёртывания
Здесь настраивается, как выполняется облачная функция агента — от этого зависят скорость, безопасность и счёт.
- Require Authentication — по умолчанию включено: агент доступен только авторизованным пользователям Firebase. Выключите — и вызвать его сможет кто угодно.
- Timeout (seconds) — сколько функция может работать до принудительной остановки. Значение
60даёт минуту; увеличивайте, если агент делает что-то долгое. - Memory — объём памяти. Больше памяти — быстрее на тяжёлых задачах и дороже. Обычно хватает
256MB, для больших данных берут512MBи выше. - Min Instances — сколько экземпляров держать наготове.
0— самый дешёвый вариант, но первый запрос будет ждать холодного старта. Больше нуля — быстрее отклик и постоянная плата. - Max Instances — потолок одновременно работающих экземпляров.
10означает не больше десяти параллельных запросов.
Когда всё настроено, нажмите Publish.
После развёртывания любое изменение настроек — системного сообщения, модели, температуры — требует повторной публикации агента. У чат-агентов Google конфигурация хранится на стороне приложения, и переразвёртывание не нужно.