OpenAI anuncia GPT-5.6 Sol em modo Ultrafast com até 750 tokens por segundo
Empresa apresentou uma prévia do modo Ultrafast para a API e publicou um guia sobre seleção de modelos e novos recursos da Responses API.

A OpenAI publicou nesta quinta-feira, 13 de agosto de 2026, uma prévia do Ultrafast, nova modalidade de serviço de sua API para executar o GPT-5.6 Sol. Segundo a empresa, a configuração pode operar em velocidade até 14 vezes maior e alcançar até 750 tokens de saída por segundo. A infraestrutura que sustenta a modalidade é fornecida pela Cerebras.
No mesmo dia, a companhia divulgou um guia voltado a quem desenvolve produtos com o GPT-5.6. O material aborda o uso do modelo por startups, a seleção mais adequada entre diferentes modelos e novos recursos da Responses API. As duas publicações tratam de aspectos complementares: uma apresenta uma opção de processamento acelerado, enquanto a outra discute como estruturar aplicações e agentes de inteligência artificial.
Ultrafast é apresentado como modalidade da API
A OpenAI descreve o Ultrafast como uma nova modalidade de serviço, e não como um modelo independente. Na prévia, o sistema executa o GPT-5.6 Sol com uma velocidade máxima anunciada de 750 tokens de saída por segundo. A empresa também afirma que o desempenho pode ser até 14 vezes superior, sem transformar esse limite em uma garantia de velocidade idêntica para toda execução.
O emprego da expressão “até” é relevante para interpretar os números divulgados. Ela indica um teto informado pela companhia, não uma taxa constante prometida para qualquer tarefa. Os documentos fornecidos também não apresentam resultados de testes independentes, comparações detalhadas por tipo de solicitação ou uma tabela que relacione o desempenho a diferentes cargas de trabalho.
Como o comunicado define a iniciativa como uma prévia, o anúncio deve ser entendido como apresentação do serviço. As informações disponibilizadas não sustentam conclusões adicionais sobre liberação geral, preços, regiões atendidas ou condições específicas de contratação.
Cerebras fornece a infraestrutura do processamento acelerado

A Cerebras aparece no anúncio como responsável pela tecnologia que viabiliza o modo Ultrafast. A OpenAI associa essa infraestrutura à execução acelerada do GPT-5.6 Sol, mas o material fornecido não detalha a arquitetura utilizada nem informa como o processamento é distribuído.
O dado central, portanto, é a combinação anunciada entre o modelo GPT-5.6 Sol, a modalidade Ultrafast e a infraestrutura da Cerebras. A taxa de até 750 tokens de saída por segundo corresponde especificamente ao desempenho divulgado para essa configuração. Não há base nos documentos para estender o mesmo número a outras versões do GPT-5.6 ou a modalidades diferentes da API.
Essa distinção ajuda a evitar que o anúncio de velocidade seja interpretado como uma característica uniforme de toda a família de modelos. Para acompanhar outras iniciativas relacionadas à infraestrutura de IA, o Tem Papo também publicou uma matéria sobre a arquitetura RAG para conectar modelos a documentos.
Guia relaciona GPT-5.6 a agentes de inteligência artificial
Em uma publicação separada, a OpenAI apresentou um guia para desenvolvedores sobre o GPT-5.6. De acordo com a descrição oficial, o documento mostra como startups utilizam o modelo para criar agentes de inteligência artificial com mais rapidez e maior eficiência de custos. Essas características são apresentadas pela própria empresa, sem métricas adicionais nos trechos fornecidos.
O guia também coloca a seleção de modelos entre as decisões do processo de desenvolvimento. A formulação indica que a proposta não se limita a escolher automaticamente a opção mais veloz: a OpenAI associa a construção dos agentes a uma escolha considerada mais inteligente entre modelos, embora as informações disponíveis não enumerem critérios, cenários ou recomendações específicas.
O tema faz parte de um movimento acompanhado em outras empresas de tecnologia. Entre os conteúdos relacionados estão a reportagem sobre os projetos Orchard e Echoverse, da Microsoft, para pesquisa com agentes de IA e a análise da uso de IA para organizar painéis e fluxos de trabalho.
Responses API integra a orientação para desenvolvedores

Além da escolha de modelos, a publicação menciona novos recursos da Responses API. O material fornecido não lista quais são essas funções, mas posiciona a interface como parte da orientação destinada à criação de agentes com o GPT-5.6.
Com isso, o conjunto de anúncios reúne três componentes: o modelo GPT-5.6, os recursos da Responses API e uma modalidade acelerada específica para o GPT-5.6 Sol. Cada elemento ocupa uma função diferente na apresentação da OpenAI. O guia trata das decisões de construção das aplicações; a API aparece como meio para utilizar novas capacidades; e o Ultrafast é descrito como a opção de serviço voltada à execução em maior velocidade.
Anúncios ainda exigem separação entre limite e desempenho real
Os números divulgados oferecem uma referência objetiva para a prévia: ganho de até 14 vezes e produção de até 750 tokens de saída por segundo. Ao mesmo tempo, os documentos não apresentam medições por aplicação, custo associado, latência completa ou condições de acesso. Por isso, não é possível concluir, com base apenas nesses materiais, como a modalidade se comportará em todos os projetos.
O que está confirmado é que a OpenAI apresentou o Ultrafast como modalidade da API para o GPT-5.6 Sol, apoiada pela Cerebras, e publicou um guia que relaciona o GPT-5.6 à criação de agentes, à seleção de modelos e aos novos recursos da Responses API. Informações além desses pontos dependem de detalhamento posterior da empresa.
Fontes consultadas
Para avaliar o ganho na prática, equipes devem medir tempo total da tarefa, qualidade da resposta e custo por resultado, não apenas a taxa máxima de geração divulgada.