Pular para o conteúdo

A OpenAI criou um "estagiário de pesquisa". Agora a IA ajuda a construir a próxima IA

A OpenAI diz que agentes já executam tarefas de pesquisa de vários dias. Entenda o ciclo de aceleração, os limites e por que humanos ainda dirigem.

Foto de Patrick Cardoso

Patrick Cardoso

A OpenAI criou um "estagiário de pesquisa". Agora a IA ajuda a construir a próxima IA
Ilustração Editorial por IA / ai.patrickcardoso.

A OpenAI afirma ter atingido uma meta que parece saída de um paradoxo: um agente de IA capaz de assumir partes do trabalho necessário para criar IAs mais avançadas.

A empresa chama o sistema de “estagiário de pesquisa automatizado”. O nome impressiona, mas exige precisão. Não é uma máquina escolhendo sozinha o que investigar. É uma camada de execução que recebe tarefas delimitadas, trabalha em paralelo e devolve resultados para pesquisadores humanos julgarem.

O que a OpenAI anunciou

Em 6 de setembro de 2026, a OpenAI publicou dados internos sobre o uso de agentes de programação por sua organização de pesquisa. Segundo suas próprias medições, a empresa alcançou a meta anunciada no ano anterior de ter um “estagiário de pesquisa” automatizado até setembro.

A definição usada pelo laboratório é específica: um sistema que executa, sob direção humana, tarefas de pesquisa bem definidas — inclusive trabalhos que tomariam alguns dias de um pesquisador qualificado.

Isso não equivale a um cientista autônomo. O agente recebe um problema recortado. Pessoas continuam responsáveis por:

  • definir prioridades de pesquisa;
  • escolher ideias e resultados que merecem continuidade;
  • decidir quando ampliar ou interromper um experimento;
  • autorizar, pausar ou rejeitar a implantação de um sistema.

A OpenAI diz estar avançando em direção a um “pesquisador de IA automatizado” até março de 2028. Essa é uma meta declarada pela empresa, não um resultado já alcançado nem uma previsão independente.

O ciclo que muda a velocidade da pesquisa

O movimento importante não está em substituir um pesquisador por um chatbot. Está em reorganizar a esteira de trabalho.

Um pesquisador pode dividir uma hipótese em tarefas menores, abrir várias sessões de agentes e deixá-las trabalhar simultaneamente. Os agentes escrevem código, ajudam a operar experimentos, analisam resultados e resolvem partes da infraestrutura. A pessoa compara as saídas, identifica erros e decide o próximo passo.

O ciclo fica assim:

  1. humanos escolhem uma direção e formulam hipóteses;
  2. agentes executam tarefas delimitadas em paralelo;
  3. novos experimentos produzem dados e código;
  4. humanos avaliam o que funcionou e o que deve ser descartado;
  5. os resultados alimentam o desenvolvimento de agentes mais capazes.

É uma aceleração potencialmente recursiva: ferramentas de IA ajudam a pesquisar a próxima geração de ferramentas de IA. Mas “recursiva” não significa automática, infinita ou sem gargalos. Cada volta ainda depende de recursos computacionais, qualidade experimental, segurança, avaliação e julgamento humano.

A OpenAI não automatizou a pergunta científica. Automatizou parte da fila de trabalho entre a pergunta e a decisão.

— Patrick Cardoso

O número mais chamativo não mede produtividade

Em meados de agosto, a organização de pesquisa da OpenAI registrava 3,1 “dias de trabalho de agente” para cada dia de trabalho humano, usando oito horas como referência.

A expressão pode induzir a uma comparação errada. Trata-se de tempo de execução agregado dos agentes, não de três pesquisadores artificiais equivalentes a cada funcionário. Processos concorrentes podem repetir tentativas, seguir caminhos improdutivos ou produzir material que será descartado.

O dado mostra escala de uso. Não prova, sozinho, três vezes mais ciência.

A própria OpenAI reconhece a distância entre as métricas fáceis de contar e o avanço científico. Código produzido e número de experimentos são observáveis, mas o progresso pode parar em outros gargalos: uma hipótese ruim continua ruim mesmo quando testada depressa; mais execuções não garantem uma descoberta relevante; e uma alteração que melhora um benchmark pode falhar fora dele.

A empresa também informa que, no início de 2026, o pesquisador mediano usava agentes de modo modesto. Em meados de agosto, já os integrava diariamente ao trabalho e consumia mais de US$ 600 por dia em inferência, a preços de API. No percentil 90, o valor dos tokens usados passava de US$ 7 mil por dia.

Esses números revelam intensidade computacional. Não devem ser lidos como custo contábil final, retorno financeiro ou qualidade da pesquisa.

O estagiário ainda chama o supervisor

O contraponto mais importante aparece nos dados de intervenção. Nos seis meses analisados, mais da metade das tarefas bem-sucedidas com duração de quatro a oito horas exigiu uma ou mais intervenções humanas.

A palavra “bem-sucedidas” importa. Mesmo entre os trabalhos que chegaram a um resultado aceito, a maioria precisou de correção, esclarecimento ou redirecionamento no caminho.

Isso descreve uma autonomia assistida, não independência. O agente consegue sustentar trabalho por horas e lidar com tarefas mais complexas, mas ainda depende de alguém capaz de perceber quando a execução se afastou do objetivo.

Há também um efeito de seleção: uma tarefa bem definida é justamente aquela que pode ser especificada, acompanhada e avaliada. Formular uma pergunta original, decidir qual evidência mudaria uma crença e reconhecer uma descoberta inesperada são partes menos fáceis de empacotar.

Mais código não é o mesmo que mais ciência

Agentes de programação combinam bem com pesquisa de IA porque grande parte do trabalho passa por software: preparar avaliações, ajustar pipelines, investigar falhas, monitorar execuções e comparar resultados.

A aceleração pode ser real e, ao mesmo tempo, menor do que os gráficos de atividade sugerem. Três distinções ajudam a não confundir movimento com progresso:

Métrica observadaO que ela indicaO que ela não prova
Tempo de execução dos agentesQuanto trabalho computacional foi delegadoEquivalência com horas de um pesquisador
Mais código contribuídoMaior capacidade de implementar mudançasQualidade ou relevância científica do código
Mais experimentosMaior volume de hipóteses testadasDescobertas na mesma proporção

A contribuição científica nasce da relação entre hipótese, método, evidência e interpretação. Automatizar a implementação reduz atrito. Não elimina a necessidade de decidir o que vale medir nem de desconfiar de um resultado conveniente demais.

O ganho vem do paralelismo

O “estagiário” é menos interessante como personagem e mais importante como infraestrutura. Um agente isolado pode economizar algumas horas. Vários agentes simultâneos mudam a capacidade de explorar alternativas.

Na prática, o pesquisador deixa de executar cada etapa em série e passa a coordenar uma pequena fila paralela. Uma sessão pode preparar uma avaliação; outra investiga um erro; uma terceira compara implementações. A vantagem não exige que cada agente seja perfeito. Exige que o custo de delegar, revisar e corrigir seja menor do que o custo de fazer tudo manualmente.

Esse arranjo também desloca o gargalo. Quando gerar código e iniciar experimentos fica mais barato, cresce o volume de resultados que alguém precisa validar. Supervisão, avaliação e segurança passam a consumir uma parcela maior do trabalho humano.

É por isso que o anúncio não deveria ser resumido como “a IA virou cientista”. A mudança concreta é operacional: pesquisadores tornaram-se coordenadores de processos artificiais concorrentes.

Aceleração e segurança entram no mesmo circuito

A OpenAI argumenta que pesquisadores automatizados podem ajudar no alinhamento e na criação de defesas contra sistemas mais capazes. Em tese, a mesma ferramenta que acelera capacidades também pode acelerar testes de segurança.

O problema é que as duas velocidades não são automaticamente iguais. Um agente capaz de modificar infraestrutura, conduzir experimentos e produzir código em escala amplia tanto a capacidade de descoberta quanto a superfície de risco.

Na própria publicação, a empresa relata que restrições de segurança recentes afetaram atividades de pesquisa e levaram à reorganização de cargas computacionais. Isso ilustra um ponto incômodo: controles não existem fora da esteira de aceleração. Eles competem por tempo, acesso e capacidade dentro dela.

A OpenAI afirma que reduzirá ou interromperá desenvolvimento e implantação quando considerar os riscos inaceitáveis. Essa é uma política declarada pelo próprio laboratório. A eficácia dos controles precisa ser avaliada por evidências, não presumida a partir da promessa.

O que observar daqui para frente

O marco mais útil não será contar quantas horas os agentes permaneceram ligados. Será medir quanto trabalho de pesquisa válido eles concluem, com que frequência precisam de intervenção e quantos resultados sobrevivem à revisão.

Quatro sinais merecem atenção:

  • queda consistente da intervenção humana em tarefas longas;
  • avaliações capazes de medir contribuição científica, e não apenas atividade;
  • transparência sobre falhas, tentativas descartadas e incidentes;
  • separação clara entre avanço em capacidade e avanço em segurança.

Também será preciso observar quem pode auditar as conclusões. Todos os números deste anúncio vêm da própria OpenAI, usam ferramentas internas em rápida mudança e foram apresentados pela empresa como medições preliminares. Eles mostram como o laboratório enxerga a própria transformação; não constituem validação externa do marco.

A próxima IA já tem ajuda da atual

A fronteira não é uma IA fazendo ciência sozinha. É uma esteira em que humanos escolhem a direção e agentes ocupam cada vez mais etapas da execução.

Isso já importa. Paralelismo pode encurtar ciclos de desenvolvimento, aumentar o número de caminhos explorados e tornar mais rápida a criação dos modelos seguintes. Também pode multiplicar erros, elevar custos de verificação e pressionar controles de segurança.

O “estagiário de pesquisa” da OpenAI ainda precisa de supervisão frequente. Mesmo assim, ele marca uma mudança: a IA deixou de ser apenas o objeto do experimento. Agora também trabalha na bancada.

Fontes

Tags relacionadas

Compartilhar

Newsletter

Novos posts direto no seu e-mail

Quando publicar algo novo, você recebe primeiro — sem feed, sem algoritmo.

Sem spam. Cancele quando quiser.

Continue lendo

Leituras relacionadas