AI-агенты

AI-агент во FlutterFlow — это настроенный вами вызов модели: вы описываете его в билдере, а из приложения дёргаете действием. Так в приложение добавляются чат, генерация изображений и видео, синтез и распознавание речи.

Агенты работают с моделями OpenAI, Google, Anthropic и ElevenLabs. От выбранного вида агента зависит, что он умеет: вести диалог, озвучивать текст, расшифровывать аудио, рисовать картинки по описанию или собирать короткие видео.

Примеры:

  • Стилист. В приложении для покупки одежды агент разбирает фотографии вещей из гардероба и подсказывает сочетания по цвету, стилю и сезону.
  • Помощник на кухне. Предлагает рецепты из имеющихся продуктов с учётом ограничений в питании и ведёт пользователя по шагам.
  • Генератор картинок для маркетинга. Делает обложки товаров, посты для соцсетей и баннеры кампаний по текстовому описанию.
  • Приложение для изучения языка. Синтез речи читает фразы вслух — слышно, как они звучат.
  • Заметки со встреч. Распознавание речи превращает записи и голосовые заметки в текст, по которому можно искать.
  • Промо-ролики. Генерация видео собирает короткие клипы для анонсов и рекламы.
инфо
Что нужно заранее
  1. Пройдено подключение Firebase. Особое внимание — пунктам 5 и 8 в разделе Выдайте FlutterFlow доступ к проекту: пользователю firebase@flutterflow.io нужна роль Cloud Functions Admin.
  2. Проект Firebase переведён на тариф Blaze — запросы к моделям идут через облачные функции.
  3. Есть ключ API нужного провайдера: OpenAI, Anthropic, Google AI Studio или ElevenLabs.

Создание агента

Откройте вкладку Agents в меню слева и нажмите (+). Задайте понятное Agent Name — например, ShoppingAssistant — и нажмите Create.

инфо

На тарифе Basic доступен один агент, на Growth и выше — сколько угодно.

Дальше — общие настройки:

  • Agent Kind — что агент делает: Chat, Image Generation, Text-to-Speech, Speech-to-Text или Video Generation.
  • Internal Description — короткая заметка для вас; модели она не передаётся.

заметка

Вид агента определяет и набор настроек, и то, каким действием его вызывать: агент Chat работает с действием Send Message, агент Image Generation — с Generate Image.

Chat

Агент вида Chat ведёт диалог: отвечает текстом, разметкой markdown или структурированным JSON. На нём строят поддержку, обучающих ассистентов, подборщиков товаров и разборщиков присланных пользователем текстов, картинок, PDF, аудио и видео.

System Message

Задаёт роль и манеру ответов. Строка вроде «You are an AI fashion stylist…» заставляет агента отвечать как стилист — про образы, цвета и сочетания.

Preloaded Messages

Заранее заданные реплики показывают агенту, в каком виде отвечать.

  • Role — от кого сообщение: User или Assistant.
  • Message — текст реплики.
  • Пример:
    • User: «Что надеть в солнечный день при среднем тоне кожи?»
    • Assistant: «Пастельный верх и белые чиносы. Добавьте солнцезащитные очки и удобную обувь».
совет

Задайте хотя бы одну пару «вопрос — ответ»: так агент точнее попадает в нужный формат.

Model Settings

  • Provider — поставщик модели: OpenAI, Google или Anthropic.
    • OpenAI и Anthropic. FlutterFlow создаст в Firebase облачную функцию, которая передаёт запросы в API. Поэтому проект Firebase должен быть на платном тарифе Blaze. Функция доступна только авторизованным пользователям.
    • Google. В проекте Firebase нужно включить:
  • Model — конкретная модель выбранного провайдера. Модели отличаются возможностями, набором параметров и ценой.
  • API Key — ключ провайдера, если он нужен. FlutterFlow хранит его внутри облачной функции: в приложение и в сетевые запросы ключ не попадает.

Request Options

Что пользователь может отправить агенту:

  • Text — текст: вопросы, описания, запросы.
  • Image — фотографии для разбора: предметы, стили, обстановка.
  • PDF (только Anthropic и Google) — документы: резюме, отчёты, анкеты.
  • Audio (только Google) — записи голоса: расшифровка, тон сообщения, голосовые команды.
  • Video (только Google) — видеофайлы для разбора.

Несколько типов ввода сразу упрощают жизнь пользователю: в том же стилисте с включёнными Text и Image он может либо описать вещь словами, либо просто прислать фото.

Response Options

В каком виде агент отвечает:

  • Text — обычный текст.
  • Markdown — с заголовками, списками и ссылками, если вы выводите ответ как markdown. Полезно для справочного бота.
  • JSON — структурированные данные, которые можно разобрать в коде: { name: 'Pizza Palace', distance: '2.4 miles' } — и сразу на карту.

Model Parameters

  • Temperature — насколько ответы предсказуемы, от 0 до 1. Ниже (0.1) — суше и стабильнее; выше (1.0) — разнообразнее, годится для генерации идей.
  • Max Tokens — предел на запрос и ответ вместе. Ограничивает расходы и длину ответов.
  • Top P — ещё один способ управлять разнообразием слов. Обычно оставляют по умолчанию.

Например, помощнику по написанию текстов ставят температуру повыше и щедрый лимит токенов, а финансовому боту — низкую температуру: там нужна одинаковость, а не фантазия.

Send Message [Действие]

Действие передаёт агенту ввод пользователя — текст, картинку — и возвращает ответ. Обычно его вешают на кнопку «Отправить» рядом с полем ввода.

  • Select Agent — какой агент отвечает.
  • Conversation ID — идентификатор диалога. Одинаковый ID (например, user123_AIStylist_202503181200) сохраняет контекст между сообщениями, и разговор остаётся связным.
  • Text Input — сообщение пользователя, обычно из Widget State поля ввода.
  • Image Input — картинка, если агент её принимает.
  • Audio Input — аудиофайл, если агент его принимает.
  • Video Input — видеофайл, если агент его принимает.
инфо
  • Action Output Variable Name — переменная с ответом агента: её выводят пользователю или обрабатывают дальше.

Настройка действия Send Message

Clear Chat History [Действие]

Действие сбрасывает контекст диалога: принимает Conversation ID и перестаёт ссылаться на прежнюю ветку при следующем сообщении.

Настройка действия Clear Chat History

Синтез речи

Агент Text-to-Speech озвучивает текст: читает сообщения вслух, наговаривает дикторский текст, делает озвучку.

Настройки:

  • Provider — поставщик синтеза, например ElevenLabs.
  • Model — модель синтеза, например Eleven Flash v2.5.
  • API Key — ключ провайдера для облачной функции.
  • Voice ID — голос по умолчанию; в действии его можно переопределить.
  • Output Format — формат аудио, например MP3.
  • Stability — насколько ровно звучит голос.
  • Similarity Boost — насколько результат держится выбранного голоса.
  • Speed — темп речи.

Настройки агента синтеза речи

Generate Speech [Действие]

Действие отправляет текст агенту синтеза и получает аудио.

  • Select TTS Agent — какой агент озвучивает.
  • Text Input — текст для озвучки.
  • Voice ID Override — другой голос только для этого вызова, необязательно.
  • Action Output Variable Name — переменная с готовым аудио.

Настройка действия Generate Speech

Распознавание речи

Агент Speech-to-Text превращает аудио в текст: голосовые заметки, записи встреч, обращения в поддержку, файлы по ссылке.

Настройки:

  • Provider — поставщик распознавания, например ElevenLabs.
  • Model — модель, например Scribe v2.
  • API Key — ключ провайдера для облачной функции.

Настройки агента распознавания речи

Transcribe Audio [Действие]

Действие отправляет аудио агенту и возвращает расшифровку.

  • Select STT Agent — какой агент расшифровывает.
  • Audio Source — откуда взять запись: Audio URL или Uploaded Audio File.
  • Language Code — код языка, например en, необязательно.
  • Action Output Variable Name — переменная с расшифрованным текстом.

Настройка действия Transcribe Audio

Генерация изображений

Агент Image Generation рисует картинку по описанию — обложки товаров, аватары, фоны, баннеры кампаний.

Настройки:

  • Provider — поставщик: Google или OpenAI.
  • Model — модель генерации: Gemini или GPT Image.
  • API Key — ключ провайдера для облачной функции.
  • Image Size — размер по умолчанию; в действии его можно переопределить.

Настройки агента генерации изображений

Generate Image [Действие]

  • Select Image Generation Agent — какой агент рисует.
  • Prompt — описание нужной картинки.
  • Size Override — размер только для этого вызова: Use Agent Default либо Square (1024 × 1024), Portrait (1024 × 1536), Landscape (1536 × 1024).
  • Action Output Variable Name — переменная с готовым изображением.

Настройка действия Generate Image

Генерация видео

Агент Video Generation собирает видео по описанию: короткие клипы, анонсы, раскадровки, ролики для соцсетей.

Настройки:

  • Provider — поставщик, например Google.
  • Model — модель, например Veo 3.1.
  • API Key — ключ провайдера для облачной функции.
  • Aspect Ratio — соотношение сторон по умолчанию; в действии его можно переопределить.
  • Duration — желаемая длительность.

Настройки агента генерации видео

инфо

Генерация видео занимает от 30 секунд до нескольких минут. Всё это время облачная функция держит соединение открытым.

Generate Video [Действие]

  • Select Video Generation Agent — какой агент собирает видео.
  • Prompt — описание ролика.
  • Aspect Ratio Override — соотношение сторон только для этого вызова: Use Agent Default либо Landscape (16:9), Portrait (9:16), Square (1:1).
  • Action Output Variable Name — переменная с готовым видео.

Настройка действия Generate Video

Параметры развёртывания

Здесь настраивается, как выполняется облачная функция агента — от этого зависят скорость, безопасность и счёт.

  • Require Authentication — по умолчанию включено: агент доступен только авторизованным пользователям Firebase. Выключите — и вызвать его сможет кто угодно.
  • Timeout (seconds) — сколько функция может работать до принудительной остановки. Значение 60 даёт минуту; увеличивайте, если агент делает что-то долгое.
  • Memory — объём памяти. Больше памяти — быстрее на тяжёлых задачах и дороже. Обычно хватает 256MB, для больших данных берут 512MB и выше.
  • Min Instances — сколько экземпляров держать наготове. 0 — самый дешёвый вариант, но первый запрос будет ждать холодного старта. Больше нуля — быстрее отклик и постоянная плата.
  • Max Instances — потолок одновременно работающих экземпляров. 10 означает не больше десяти параллельных запросов.

Когда всё настроено, нажмите Publish.

инфо
Для агентов не от Google

После развёртывания любое изменение настроек — системного сообщения, модели, температуры — требует повторной публикации агента. У чат-агентов Google конфигурация хранится на стороне приложения, и переразвёртывание не нужно.

перевод официальной документации FlutterFlow

обновлено

ESC