GPT Image

GPT Image
Watercolor-style image generated by GPT Image 1.5
ТипГенерація та редагування зображень
РозробникOpenAI
Перший випуск25 березня 2025 (2025-03-25)
Стабільний випуск1.5 (16 грудня, 2025 (2025-12-16))
ВебсайтChatGPT Images

GPT Image — серія моделей для генерації та редагування зображень, розроблених компанією OpenAI. Модель перетворення тексту на зображення GPT, яка використовує методи глибокого навчання для створення цифрових зображень з описів природною мовою та/або зображень. Як наступник DALL-E, GPT Image є рідною для ChatGPT та доступною через API. Після випуску в березні 2025 року GPT Image став вірусним у соцмережах, зокрема завдяки своїй здатності генерувати зображення в стилі Studio Ghibli. GPT Image також доступний з Microsoft Copilot та Apple Intelligence.

Історія

Першу модель GPT Image було представлено OpenAI як «генерацію зображень GPT-4o» у блозі від 25 березня 2025 року, розроблену на основі моделі GPT-4o для генерації зображень.[1] Спочатку вона була доступна лише платним користувачам, а дозвіл для безкоштовних користувачів було затримано через високий попит.[2] Згодом використання цієї функції було обмежене, а Сем Альтман заявив, що графічні процесори «тануть» від рівня використання.[3] Пізніше OpenAI заявила, що понад 130 мільйонів користувачів у всьому світі створили понад 700 мільйонів зображень за перший тиждень.[4] Модель отримала назву GPT Image 1 та була представлена 23 квітня. Економічно ефективна версія була випущена як GPT Image 1 Mini 6 жовтня, також на OpenAI DevDay 2025, причому вартість в API була на 80% нижчою, ніж у GPT Image 1.[5][6]

16 грудня було представлено нову модель під назвою GPT Image 1.5, яка була розгорнута глобально як «ChatGPT Images» для всіх користувачів і одразу стала доступною через API.[7] OpenAI стверджує, що нова модель може виконувати точні редагування, зберігаючи деталі недоторканими, і генерує зображення до чотирьох разів швидше. Вхідні та вихідні зображення в API на 20% дешевші в GPT Image 1.5 порівняно з GPT Image 1.[2]

Можливості

На відміну від дифузійних попередників моделей DALL-2 та DALL-3, моделі GPT Image є авторегресивними з кількома новими можливостями, включаючи перетворення зображень на зображення, розширений фотореалізм та детальне виконання інструкцій.[2] GPT Image може генерувати зображення трьох розмірів, а саме 1024 × 1024 (1:1, квадрат), 1536 × 1024 (3:2, альбомна орієнтація) та 1024 × 1536 (2:3, портретна орієнтація) пкс.[3]

GPT Image 1.5 вирішує проблему передчасного кадрування та упередження теплих кольорів, характерне для попередньої моделі[1], але воно регресувало для генерації в деяких специфічних художніх стилях. Більше того, слабкість кількох граней та деяких мов, таких як китайська, арабська, іврит тощо, все ще залишається в останній моделі[7].

Сприйняття

Експерти з технологій загалом розглядали GPT Image як значний прогрес у створенні зображень. TechRadar підкреслив, що GPT Image 1 забезпечує вражаючу продуктивність, здатну створювати широкий спектр результатів – від фотореалістичних сцен до стилізованих ілюстрацій, відзначаючи помітні покращення у відтворенні тексту та мультимодальній інтеграції порівняно з попередніми інструментами. Однак Heise Online повідомив, що GPT Image 1 демонструє технічні недоліки, такі як артефакти надмірної різкості, теплий колірний зміщення та поширені помилки у відображенні людських поз та перекриття об'єктів, що вказує на обмеження реалізму виводу, незважаючи на загальну високу продуктивність.[2]

Культурний вплив

Зображення, згенероване за допомогою GPT Image 1 з офіційного облікового запису Білого дому в Твіттері, що показує арешт мігранта. Зображення у стилі Studio Ghibli зазнало критики.

Після запуску GPT Image 1 у березні 2025 року фотографії, відтворені у стилі фільмів Studio Ghibli, стали вірусними.[2] Сем Альтман визнав цю тенденцію, змінивши свою фотографію профілю в Twitter на натхненну Studio Ghibli.[3][4] Офіційний акаунт Білого дому в Twitter опублікував зображення в стилі Ghibli, що висміює арешт імміграційними органами Вірджинії Басори-Гонсалес, мігрантки, яку раніше депортували після засудження за торгівлю фентанілом, на якому видно, як вона плаче, коли імміграційний офіцер надягає на неї кайданки.[8][5][6] Північноамериканський дистриб'ютор GKids відреагував на цю тенденцію в прес-релізі, порівнявши використання фільтра з тим, що він збігся з перевипуском фільму Studio Ghibli 1997 року «Принцеса Мононоке» у форматі IMAX.[2]

Див. також

Примітки

  1. а б Introducing 4o Image Generation. OpenAI. 25 березня 2025. Архів оригіналу за 5 жовтня 2025. Процитовано 17 грудня 2025.
  2. а б в г д е Roth, Emma (26 березня 2025). ChatGPT's new image generator is delayed for free users. The Verge. Процитовано 26 березня 2025.
  3. а б в Welch, Chris (27 березня 2025). OpenAI says "our GPUs are melting" as it limits ChatGPT image generation requests. The Verge. Процитовано 28 березня 2025.
  4. а б Introducing our latest image generation model in the API. OpenAI. 23 квітня 2025. Процитовано 30 квітня 2025.
  5. а б OpenAI DevDay 2025. OpenAI. 6 жовтня 2025. Архів оригіналу за 21 жовтня 2025. Процитовано 17 грудня 2025.
  6. а б Matthias Bastian (6 жовтня 2025). Developers can now build and deploy both apps and agents directly on the ChatGPT platform. The Decoder. Архів оригіналу за 7 жовтня 2025. Процитовано 17 грудня 2025.
  7. а б The new ChatGPT Images is here. OpenAI. 16 грудня 2025. Архів оригіналу за 17 грудня 2025. Процитовано 17 грудня 2025.
  8. O'Brien, Matt; Parvini, Sarah (27 березня 2025). ChatGPT's viral Studio Ghibli-style images highlight AI copyright concerns. AP News (англ.). Процитовано 28 березня 2025.

Посилання