← All articles

ТЕХНИЧЕСКИЙ РАЗБОР

Генератор фотопромптов Gemini AI: история моделей, нативная мультимодальность и серьёзный план оценки

Модели генерации изображений Gemini наиболее полезны, если относиться к ним как к мультимодальной системе редактирования, а не как к одноразовому эндпоинту «текст в изображение». Это различие меняет то, как вы пишете промпты, выбираете референсные изображения и оцениваете результаты.

Cover image for Генератор фотопромптов Gemini AI: история моделей, нативная мультимодальность и серьёзный план оценки

История релизов: от превью генерации изображений до семейства Nano Banana

Google открыла генерацию изображений в Gemini API через Gemini 2.0 Flash Preview Image Generation 7 мая 2025 года. В тот же день вышло превью Gemini 2.5 Flash Image, которое получило статус общей доступности 2 октября 2025 года под именем Nano Banana. Стабильная модель 2.5 теперь является устаревшим членом более широкого семейства: Gemini 3.1 Flash Lite Image позиционируется для высокой пропускной способности, Gemini 3.1 Flash Image — для общего баланса возможностей, стоимости и задержки, а Gemini 3 Pro Image — для сложной профессиональной работы.

Эта история важна с практической точки зрения. Промпт, настроенный под модель 2.5, — не вечный эталон: псевдонимы моделей, разрешение вывода, лимиты на референсные изображения и даты вывода из эксплуатации меняются. Фиксируйте точный идентификатор модели и дату при каждом сравнении результатов и не относитесь к маркетинговому названию как к ключу воспроизводимости.

Техническая идея: нативный мультимодальный цикл генерации и редактирования

Google описывает Gemini 2.5 Flash Image как нативно мультимодальную: текст и изображения обрабатываются в едином рабочем процессе, а не как изолированный этап составления подписи, за которым следует отдельная модель генерации изображений. Практическое следствие в том, что один и тот же диалоговый контекст может содержать инструкцию, одну или несколько референсных картинок и последовательность правок.

Это не значит, что модель идеально сохраняет каждый пиксель или идентичность. Это значит, что изображения на входе являются полноценными управляющими сигналами. На практике промпты должны указывать роль каждого референса: какое изображение задаёт субъект, какое — материал или палитру, а какие свойства должны остаться неизменными. Неоднозначные промпты с несколькими изображениями заставляют модель самостоятельно разрешать конфликт замысла, который вы не уточнили.

Что на самом деле говорит публичная документация

Актуальный гид по изображениям Gemini документирует генерацию по тексту, редактирование текста и изображений, композицию из нескольких изображений, настраиваемое соотношение сторон и разрешение вывода вплоть до 4K на моделях верхнего уровня Gemini 3. Также описываются заземление на поиск (search grounding) и процесс «размышления» для отдельных моделей изображений Gemini 3. Это описание возможностей продукта, а не опубликованный отчёт об архитектуре модели, обучающем корпусе, количестве параметров или устройстве диффузии/декодера; Google не предоставила эти технические детали в указанной документации продукта.

Та же документация задаёт жёсткие ограничения, которые должны определять промпты в продакшене. Gemini 2.5 Flash Image лучше всего работает с не более чем тремя входными изображениями. Gemini 3 Pro Image поддерживает до пяти высококачественных референсных изображений и до четырнадцати входов в сумме, а для Gemini 3.1 Flash Image задокументированы отдельные лимиты для сходства персонажа и точности передачи объекта. Каждое сгенерированное изображение содержит водяной знак SynthID.

Оценка: отделяйте следование инструкциям от предпочтения по картинке

Эстетического предпочтения недостаточно для оценки генератора промптов. Постройте фиксированный набор тестовых брифов, каждый из которых проверяет отдельную способность: точность передачи единственного субъекта, точный текст, ограниченные правки, точность подсчёта объектов, композицию из нескольких референсов, консистентность персонажа и соблюдение соотношения сторон. Для каждого брифа фиксируйте модель, размер, контроль сида (если доступен) и референсные входы; варьируйте только формулировку промпта, которую вы тестируете.

Оценивайте каждый результат по рубрике, а не по единственной метке «победитель». Полезная рубрика включает покрытие требований, сохранение защищённых элементов, точность текста, пространственную корректность, нежелательные артефакты и итоговое визуальное качество. Для суждений, чувствительных к вкусу, используйте слепое попарное сравнение с участием людей, а затем указывайте количество промптов, число изображений на промпт, число оценщиков и доверительные интервалы. Без этих деталей скриншот таблицы лидеров — лишь свидетельство выборки предпочтений, а не общее утверждение о превосходстве.

  • Покрытие инструкций: появилось ли каждое явно требуемое условие и отсутствует ли каждое явно запрещённое?
  • Локальность правки: произошло ли запрошенное изменение без побочного смещения идентичности, композиции или стиля?
  • Точность передачи референса: сохранил ли результат заявленную роль каждого входного изображения, а не просто стал похож на одно из них?
  • Операционная стоимость: измеряйте задержку, частоту сбоев, количество повторов и фактическую стоимость на принятый актив — а не только стоимость одного вызова API.

Как составлять промпты в фотографическом рабочем процессе

Начните со спецификации сцены: субъект, окружение, камера/кадрирование, освещение, признаки материала и предполагаемый формат вывода. Затем добавьте явные ограничения и компактный «контракт правки». Для сложной работы используйте короткий первый проход для установления композиции, а затем внесите одну целевую последующую правку — вместо того чтобы нагромождать все возможные изменения в первоначальный запрос.

Для генератора фотопромптов самый ценный результат — не максимально длинный абзац. Это промпт, который сохраняет проверяемые решения: что является субъектом, какие визуальные атрибуты не подлежат изменению, что должно оставаться стабильным при правке, и какой формат требуется. Мультимодальный рабочий процесс Gemini работает сильнее всего, когда такая структура делает роли референсов однозначными.