Модели GPT-image хорошо обрабатывают запросы на естественном языке и, как правило, создают связные, визуально проработанные изображения для большинства распространённых типов сцен, стилей иллюстраций и фотореалистичных сюжетов. Ожидайте хороших результатов для ландшафтов, портретов, архитектурных сцен и стилизованных иллюстраций. Отображение текста внутри изображений (вывески, надписи, логотипы) — область, где модели генерации изображений на основе ИИ всё ещё часто допускают ошибки: буквы могут быть написаны с ошибками, перепутаны или стилистически несогласованы. Сложные сцены с несколькими персонажами и конкретными пространственными отношениями также могут получаться нестабильно. Генерация обычно занимает 10–30 секунд, хотя при высокой нагрузке это время может увеличиться. Модель применяет фильтры контента, поэтому запросы, касающиеся насилия, откровенного контента или реальных именованных людей, могут быть отклонены или изменены без предупреждения. Лучший вариант ввода: сфокусированный запрос, включающий объект, композицию, стиль, освещение, соотношение сторон и ограничения, а не длинный список конкурирующих идей.
Пример: Ввод: «кинематографичное фото керамической кофейной кружки на мраморной столешнице, мягкий утренний свет из окна, малая глубина резкости, 4:5». Результат: новое изображение, соответствующее описанной композиции и освещению. Подходит для концептуальных визуалов, иллюстраций для блогов, публикаций в соцсетях и мудбордов продуктов.