Criar imagens no ChatGPT deixou de ser um recurso paralelo e virou uma das coisas que a ferramenta faz de melhor. Desde abril de 2026, a geração de imagens roda no ChatGPT Images 2.0, um modelo nativo que substituiu de vez o DALL·E — aposentado em maio do mesmo ano — e que acertou o problema mais persistente de toda IA de imagem: escrever texto dentro da figura sem errar as letras.
Isso muda o tipo de coisa que dá para fazer. Cartaz com título legível, infográfico com números corretos, capa com o nome da marca, página de história em quadrinhos com falas, mockup de embalagem com rótulo — tudo isso saía torto antes e agora sai limpo na maioria das tentativas.
Este guia cobre o caminho completo: como gerar a primeira imagem, como escrever o prompt do jeito que o ChatGPT entende melhor, como editar sem regenerar tudo, como manter o mesmo personagem entre imagens, o que muda entre o plano gratuito e o pago, e o que a ferramenta ainda não faz bem.
O que mudou na geração de imagens do ChatGPT
Até 2025, o ChatGPT gerava imagens acionando o DALL·E como um sistema separado: você escrevia, ele traduzia seu pedido em um prompt interno e mandava para outro modelo. O resultado era irregular, porque havia uma tradução no meio do caminho que você não controlava.
Hoje o modelo de imagem é nativo e compartilha contexto com o modelo de linguagem. Na prática isso significa que ele entende o pedido da mesma forma que entende uma pergunta de texto: se você disser "faça um cartaz para uma cafeteria que abre às 7h em Porto Alegre", ele não precisa que você descreva cada elemento visual — ele deduz layout, hierarquia e conteúdo.
Três consequências práticas importam mais que as outras:
- Texto dentro da imagem funciona. Títulos, parágrafos, rótulos, legendas e até texto em vários idiomas saem legíveis. Era o maior calcanhar de aquiles das IAs de imagem.
- Layout complexo é possível. Infográficos, spreads de revista, fichas de personagem e páginas com múltiplos painéis deixaram de ser sorte.
- Consistência entre imagens melhorou. Dá para gerar um conjunto de imagens mantendo o mesmo personagem ou o mesmo produto.
💡 Vale saber: os limites de geração de imagem no plano gratuito não são divulgados oficialmente e mudam conforme a demanda da plataforma. Trate qualquer número que você vir por aí como estimativa, não como regra fixa.
Como gerar sua primeira imagem, passo a passo
O fluxo é o mais simples possível — não existe painel separado nem configuração prévia obrigatória.
- Abra uma conversa nova. Não é necessário selecionar nenhum modo especial; basta pedir.
- Descreva a imagem em linguagem natural. Escreva como se estivesse explicando a um designer, em frases completas. Não use lista de palavras separadas por vírgula: esse formato é de outras ferramentas e aqui rende menos.
- Diga a proporção. "Formato vertical para stories", "quadrado para Instagram", "horizontal 16:9". Se você não disser, ele escolhe sozinho.
- Aguarde a geração. Imagens levam mais tempo que respostas de texto, especialmente as com layout denso.
- Peça ajustes na própria conversa. "Deixe o fundo mais escuro", "aumente o título", "troque a cor do casaco para vermelho". Ele mantém a imagem e altera só o que você pediu.
- Baixe em resolução cheia. Use o botão de download, e não captura de tela — a captura perde qualidade e vem no tamanho da sua janela.
Esse último ponto é mais importante do que parece. Muita gente salva a imagem clicando com o botão direito na miniatura e acaba com um arquivo pequeno e recomprimido.
Os dois modos: instantâneo e raciocínio
O ChatGPT Images 2.0 opera em dois modos, e entender a diferença evita frustração.
O modo instantâneo gera direto a partir do seu pedido. É rápido, disponível em todos os planos incluindo o gratuito, e cobre bem imagens simples: uma cena, um retrato, uma ilustração, um fundo.
O modo com raciocínio — o "thinking" — faz o modelo planejar antes de desenhar: ele verifica quantidade de objetos, confere as restrições que você pediu, organiza o layout e, quando necessário, pesquisa na web para trazer informação atualizada para dentro da imagem. É esse modo que entrega infográfico correto, cartaz com dados reais e composição com muitos elementos alinhados. Está restrito aos planos pagos.
Na prática: se o seu pedido tem uma cena só, o modo instantâneo basta. Se tem contagem ("exatamente cinco ícones"), hierarquia de texto ou dados que precisam estar certos, o raciocínio faz diferença real.
Como escrever prompts que o ChatGPT entende melhor
Aqui está a maior diferença entre o ChatGPT e ferramentas como Midjourney: ele prefere prosa a lista de tags. Escrever "mulher, 35 anos, blazer cinza, escritório, 85mm, bokeh" funciona, mas rende menos do que a mesma informação em frases.
Comece pela função da imagem, não pela descrição
Dizer para que serve muda o resultado inteiro. "Um cartaz de divulgação para o workshop de fotografia do dia 12" produz algo muito mais utilizável do que "uma imagem com uma câmera e um texto". O modelo usa a finalidade para decidir hierarquia, espaço e estilo.
Escreva o texto exato entre aspas
Quando a imagem precisa conter palavras, escreva-as literalmente e entre aspas: o título "Café da Manhã", o subtítulo "todos os sábados, das 8h às 11h". Sem aspas, o modelo pode parafrasear ou inventar. E diga onde cada texto fica: topo, rodapé, canto inferior direito.
Descreva a estrutura antes do estilo
A ordem que funciona é: o que aparece e onde → depois como parece. "Três colunas iguais, ícone no topo de cada uma, título abaixo e um parágrafo curto embaixo; estilo minimalista com fundo bege e tipografia sem serifa." Estrutura primeiro dá muito menos retrabalho.
Seja explícito sobre o que não quer
O ChatGPT não tem campo de prompt negativo. A restrição entra dentro do próprio pedido, e funciona melhor em forma afirmativa: "composição limpa, sem nenhum texto além do título" rende mais do que "sem texto".
Itere em vez de reescrever
É o maior diferencial da interface conversacional. Não reescreva o prompt do zero quando algo sai errado: peça a correção. "Mantenha tudo, mas troque o fundo para azul-marinho" preserva o que já estava bom. Reescrever o prompt inteiro gera uma imagem nova sem relação com a anterior.
💡 Atalho útil: peça ao próprio ChatGPT para melhorar seu prompt antes de gerar. "Reescreva este pedido como um prompt detalhado de imagem, sem gerar nada ainda" costuma revelar detalhes que você não tinha pensado.
Proporção e resolução: o que pedir
O modelo aceita uma faixa ampla de formatos, de ultra-largos a ultra-altos, e gera em até 2K. Definir a proporção antes de gerar evita recorte depois — e recorte depois sempre custa composição.
| Destino | Como pedir | Proporção |
|---|---|---|
| Feed do Instagram | formato quadrado | 1:1 |
| Feed vertical / retrato | formato retrato para feed | 4:5 |
| Stories e Reels | formato vertical de stories | 9:16 |
| Thumbnail de YouTube | formato horizontal widescreen | 16:9 |
| Banner de site | formato panorâmico largo | 3:1 |
| Capa de e-book | formato vertical de capa de livro | 2:3 |
| Wallpaper de desktop | formato horizontal widescreen | 16:9 |
Se você precisa de uma resolução específica — 1920 por 1080, por exemplo — gere na proporção certa e ajuste depois com o redimensionador de imagem. Pedir dimensões exatas em pixels dentro do prompt raramente é respeitado ao pé da letra.
Editar imagens: os comandos que funcionam
Editar é onde o ChatGPT se destaca em relação a ferramentas de geração pura. Você não precisa de máscara, camada nem seleção — descreve em palavras.
Alterar um elemento específico
"Mantenha a composição e troque apenas a cor da parede para verde-sálvia." Quanto mais explícito você for sobre o que deve permanecer igual, menos o modelo mexe no resto. A palavra "mantenha" faz um trabalho surpreendentemente grande aqui.
Adicionar ou remover objetos
"Remova a planta do canto direito e deixe a parede lisa." Funciona bem com objetos claramente delimitados. Remoções em áreas com muita textura de fundo às vezes deixam marcas — nesse caso, gerar de novo costuma sair melhor do que insistir na edição.
Trocar o estilo mantendo a cena
"Mesma composição, mesmos elementos, mas em estilo aquarela." É útil para testar linguagens visuais diferentes sem perder o enquadramento que você já aprovou.
Editar a partir de uma imagem sua
Você pode enviar uma foto e pedir alterações: mudar o fundo, ajustar a iluminação, transformar em ilustração, criar variações. Vale lembrar que o resultado é uma imagem nova gerada a partir da sua, não uma edição pixel a pixel do original.
Expandir o enquadramento
"Expanda esta imagem para o formato horizontal, continuando o cenário naturalmente para os lados." É o equivalente conversacional do outpainting, e resolve o caso clássico de ter uma imagem vertical que precisa virar banner.
Como manter o mesmo personagem em várias imagens
Esse era o problema mais difícil das IAs de imagem e ficou bem mais tratável. Três abordagens, da mais simples para a mais confiável.
Continuar na mesma conversa. É o método mais fácil e o mais eficaz no dia a dia. Depois de gerar o personagem, peça a próxima cena sem redescrevê-lo: "agora mostre o mesmo personagem sentado em um café". O modelo carrega o contexto da conversa e mantém os traços.
Descrever traços fixos por escrito. Monte uma descrição curta e imutável — cabelo, olhos, roupa característica, acessório marcante — e repita exatamente as mesmas palavras em todos os pedidos. Sinônimos atrapalham: "casaco bege" e "sobretudo cor de areia" produzem peças diferentes.
Pedir uma folha de referência primeiro. Gere uma ficha de personagem com o mesmo rosto em vários ângulos e expressões, e use essa imagem como referência nas gerações seguintes. É o caminho mais trabalhoso e o mais consistente, especialmente para séries longas.
Vale a mesma lógica para produtos e para identidade de marca: quanto mais fixa a descrição, mais estável o resultado.
Gratuito ou pago: o que realmente muda
A geração de imagens está disponível em todos os planos, inclusive no gratuito. O que varia é volume, velocidade e acesso ao modo com raciocínio.
| Aspecto | Plano gratuito | Planos pagos |
|---|---|---|
| Geração de imagem | Disponível, modo instantâneo | Disponível, instantâneo e raciocínio |
| Volume | Limitado, cota não divulgada | Bem mais alto |
| Velocidade | Mais lenta, sujeita a fila | Prioridade em horários de pico |
| Pesquisa na web durante a geração | Não | Sim, no modo raciocínio |
| Layouts complexos e infográficos | Resultado irregular | Bem mais confiável |
| Conjuntos de imagens consistentes | Limitado | Sim |
Para uso pessoal ocasional — um wallpaper, uma ilustração para um post, uma imagem de apoio — o plano gratuito resolve. Para trabalho recorrente com layout, texto e volume, a diferença aparece rápido. Se você quer comparar com outras opções antes de assinar, o guia das melhores IAs para criar imagens coloca os principais nomes lado a lado, e o guia do Gemini para criar imagens cobre a principal alternativa.
O que o ChatGPT ainda não faz bem
Saber as limitações economiza tempo. Nenhuma delas é defeito de prompt: são limites da ferramenta.
- Pessoas reais. Gerar imagens de pessoas identificáveis, especialmente figuras públicas, é bloqueado. Não adianta reformular o pedido.
- Marcas e personagens licenciados. Logotipos de empresas existentes e personagens protegidos por direitos autorais também são recusados.
- Vetor de verdade. A saída é sempre rasterizada, em pixels. Se você precisa de arquivo editável em curvas, o resultado serve como referência para redesenhar, não como arquivo final.
- Fundo transparente confiável. Mesmo pedindo, a imagem costuma vir com fundo sólido. A transparência é mais rápida de resolver depois, removendo o fundo.
- Resolução acima de 2K. Para impressão grande ou monitor 4K, é necessário ampliar depois.
- Reprodução exata de uma foto sua. Ao editar uma imagem enviada, o modelo regenera a cena. Detalhes finos do original mudam.
Sete erros que mais atrapalham
- Escrever em formato de tags. Lista de palavras separadas por vírgula é a linguagem de outras ferramentas. Aqui, prosa rende mais.
- Não dizer a proporção. Sem indicação, o modelo escolhe — e quase sempre escolhe o formato errado para o seu uso.
- Reescrever o prompt a cada tentativa. Você perde o que já tinha acertado. Peça correções pontuais.
- Deixar o texto solto no pedido. Sem aspas e sem posição, o modelo parafraseia ou coloca onde quiser.
- Salvar por captura de tela. Perde resolução e adiciona recompressão. Use o download.
- Pedir tudo de uma vez. Prompts com dez exigências simultâneas costumam falhar em duas ou três. Gere a base e ajuste em etapas.
- Publicar direto sem otimizar. Uma imagem de 2K em PNG pesa vários megabytes e derruba o carregamento de qualquer página.
O que fazer com a imagem depois de gerar
Esse último ponto merece detalhe, porque é onde a maioria erra. A imagem que sai do ChatGPT está pronta para ser vista, não para ser publicada.
Converta para o formato certo. PNG é ótimo para transparência e péssimo para foto na web. Para site, WebP costuma reduzir o peso pela metade sem diferença visível; para envio comum, JPG resolve. O conversor de imagem faz a troca direto no navegador, e o guia de formatos de imagem ajuda a escolher.
Reduza o peso. Uma imagem em 2K pode passar de 5 MB. O compressor de imagem corta boa parte disso sem perda visível — e se o arquivo estiver realmente grande, o passo a passo de como reduzir imagem de MB para KB cobre os detalhes.
Isole o objeto quando precisar. Para logos, produtos e elementos que vão sobre fundo colorido, remover o fundo e salvar em PNG transparente é o passo que falta.
Ajuste resolução e enquadramento. Se a imagem saiu menor que o necessário, dá para aumentar a resolução sem perder qualidade. Se saiu na proporção errada, recortar preserva mais do que esticar.
Aproveite a paleta. Para manter coerência visual entre imagens geradas em sessões diferentes, extraia as cores da que ficou melhor e cite esses tons nos próximos prompts.
💡 Ordem que funciona: baixe em resolução cheia → recorte ou redimensione → converta o formato → comprima por último. Comprimir antes de redimensionar desperdiça qualidade.
Três exemplos de pedidos completos
Para fechar, três pedidos escritos do jeito que o ChatGPT aproveita melhor — repare que todos dizem a finalidade, o texto exato e a proporção.
Checklist antes de gerar
- Você disse para que serve a imagem, e não apenas o que ela mostra?
- A proporção está declarada?
- O texto que deve aparecer está entre aspas, com posição definida?
- A estrutura foi descrita antes do estilo?
- As restrições estão escritas de forma afirmativa?
- Você está pedindo uma correção em vez de reescrever tudo?
- Vai baixar em resolução cheia, e não por captura de tela?
Deixe suas imagens prontas para publicar
Imagens geradas em 2K passam facilmente de 5 MB. Reduza o peso sem perder qualidade visível, direto no navegador.
Comprimir imagem