Computer use é a capacidade de um agente de IA ver a tela do computador por um print, mover o cursor, clicar num botão e digitar texto, exatamente como uma pessoa faria. Isso permite automatizar qualquer sistema, incluindo ERP antigo sem API, sem projeto de integração técnica. Já saiu da demo e roda em produção, mas ainda pede supervisão em tarefa de risco.
O que é computer use e como funciona na prática?
Computer use é o nome que a Anthropic deu, em outubro de 2024, à capacidade de um modelo operar o computador pela tela: ele recebe um print, decide onde clicar, move o cursor, digita texto e confere o resultado com um novo print, num loop. A OpenAI lançou uma versão própria em janeiro de 2025, o Operator, hoje parte do modo agente do ChatGPT. Times menores, como o projeto aberto UI-TARS, seguiram o mesmo caminho.
A diferença pro RPA tradicional (UiPath, Automation Anywhere e afins) tá na base do reconhecimento. RPA clássico decora a posição exata de um botão ou o identificador de um campo na tela, o chamado selector, e quebra quando o sistema move um pixel de lugar. Computer use olha a tela do jeito que uma pessoa olha, então generaliza melhor quando o layout muda um pouco, mesmo ainda errando de vez em quando.
Como um agente de computer use automatiza sistema sem API?
O agente roda num loop de três passos: tira um print da tela, decide a próxima ação (mover mouse, clicar, digitar, rolar, esperar) e executa. Depois tira outro print pra conferir se a ação funcionou, e repete até a tarefa terminar ou até travar numa tela que não reconhece.
Não precisa de endpoint, token de API nem documentação do sistema. O agente entra do jeito que uma pessoa entra: abre o navegador ou o programa, faz login, navega pelo menu, preenche campo, aperta o botão. Pra ele, um sistema de 2008 rodando em Delphi ou um site novo em React são a mesma coisa: uma imagem de tela pra interpretar.
O preço dessa flexibilidade é velocidade e custo. Cada passo do loop consome um print de alta resolução e uma rodada de raciocínio do modelo, o que leva de alguns segundos a mais de um minuto, dependendo da complexidade da tela. Uma chamada de API que resolveria em 200 milissegundos pode virar uma sequência de 30 segundos a alguns minutos via computer use.
Quando computer use resolve o que integração via API não resolve?
O cenário onde computer use ganha da API é claro: sistema sem API nenhuma, sistema com API travada atrás de plano enterprise, ou sistema que só existe via terminal remoto ou Citrix, sem nenhum caminho de integração formal.
No post sobre quais CRM integram com agente de IA a gente mapeou 3 caminhos pra CRM sem API: camada intermediária, migração pro CRM certo, ou operar sem sistema formal no início. Computer use entra como um quarto caminho: em vez de contornar a falta de API, o agente simplesmente usa a tela como uma pessoa usaria, sem precisar que o fornecedor libere nada.
Hipotético pra deixar concreto: imagina uma distribuidora que roda o controle de estoque num sistema instalado local, sem nenhuma API, e hoje um funcionário abre o sistema toda manhã pra copiar o saldo de 40 produtos numa planilha de reposição. Um agente de computer use pode fazer login, abrir o relatório, copiar os números e colar na planilha, sozinho, todo dia, sem que ninguém precise pedir API pro fornecedor do sistema.
Quer ver onde a IA te devolve tempo na sua empresa?
Faça o mapeamento gratuito e descubra os processos do seu dia a dia que já dá pra tirar das suas costas.
Fazer o mapeamentoQuais são os riscos de usar computer use em produção?
Sendo bem sincero, computer use ainda erra tarefa que uma API bem feita nunca erraria. O modelo pode clicar no botão errado quando dois elementos da tela ficam parecidos, ou interpretar mal um texto pequeno numa resolução baixa.
Os riscos principais:
- Sem transação atômica. API tem regra de tudo ou nada; clique de tela pode parar no meio (preencheu 3 de 5 campos e travou), deixando o sistema num estado intermediário que precisa de revisão manual.
- Custo por tarefa mais alto. Cada print consome tokens de imagem, então uma tarefa de várias telas custa mais que a chamada de API equivalente.
- Sem histórico de auditoria pronto. API grava log estruturado por padrão; ação de tela precisa de gravação própria pra reconstruir o que aconteceu, se algo sair errado.
- Depende da tela estar visível e estável. Notificação, popup de atualização ou mudança de layout do sistema pode confundir o agente no meio da tarefa.
A regra prática: escrita financeira, cadastro que afeta faturamento ou qualquer ação irreversível ainda pede humano revisando antes de confirmar. Leitura, consulta, cópia de dado entre sistemas e preenchimento de formulário de baixo risco já rodam bem com supervisão mais leve.
Quanto custa e quanto tempo leva pra implementar computer use numa PME?
Não existe preço único de mercado pra computer use porque o custo varia com a complexidade da tela e o número de passos da tarefa. Como estimativa conservadora, uma tarefa simples de poucas telas (login, navegar, copiar um dado) custa poucos centavos de token por execução e leva de 1 a 3 minutos rodando; uma tarefa de dezenas de telas passa disso e custa proporcionalmente mais.
O tempo de implementação costuma ser menor que um projeto de integração via API tradicional, porque não tem etapa de negociação de acesso nem espera de aprovação de escopo com o fornecedor do sistema. Em compensação, pede mais tempo de teste e ajuste de instrução, porque uma mudança visual pequena no sistema alvo pode exigir reteste.
Pra ter escala de comparação: uma operação comercial automatizada de ponta a ponta, tipo o Super SDR, tem setup de R$8 mil a R$15 mil e infraestrutura de R$550 a R$650 por mês, porque roda uma operação inteira todo dia. Automatizar uma tarefa pontual dentro de um sistema legado via computer use é categoria de esforço bem menor, mais perto de uma ferramenta interna de fim de semana do que de um projeto de integração completo.
Vale a pena usar computer use hoje ou esperar a tecnologia amadurecer?
Vale a pena usar hoje, pra tarefa certa. Não acho que ele já substitui integração via API onde a API existe. Pq quando o sistema tem API aberta, ela continua mais rápida, mais barata e mais confiável do que operar a tela.
Computer use faz sentido como ponte pro sistema que nunca vai ganhar API, ou como solução enquanto um projeto de integração de verdade não sai do papel. Não é a ferramenta certa pra quem quer confiabilidade de 99,9% numa tarefa crítica agora. É a ferramenta certa pra quem tem uma tarefa repetitiva, de risco baixo, presa num sistema que dificilmente vai ser integrado de outro jeito.
FAQ
Computer use funciona em qualquer sistema sem nenhuma configuração? Funciona na tela de praticamente qualquer sistema, mas não é zero configuração. Precisa de instrução clara descrevendo a tarefa, acesso liberado pro agente entrar no ambiente (login, VPN, permissão de rede) e, na prática, alguns ciclos de ajuste até acertar o caminho certo. Sistema com tela poluída, com muita notificação ou popup, tende a exigir mais ajuste do que sistema com interface limpa.
Computer use substitui automação via API? Não quando a API existe e está disponível. API é mais rápida, mais barata por execução e mais confiável, porque fala direto com o sistema em vez de interpretar uma imagem de tela. Computer use entra como alternativa só quando não tem API, quando ela está travada num plano caro, ou quando o sistema não tem nenhum caminho de integração formal, caso comum em terminal antigo ou software instalado sem suporte a integração.
É seguro dar acesso de tela do computador pro agente de IA? Depende do escopo de acesso e do tipo de tarefa. Pra leitura e cópia de dado de baixo risco, o risco é baixo, parecido com dar acesso de tela pra um estagiário treinado. Pra tarefa que grava dado financeiro ou altera cadastro crítico, o recomendado é manter um humano revisando o resultado antes de confirmar a ação final, pelo menos até o histórico de acerto daquela tarefa específica ficar comprovado.
Quanto tempo leva pra automatizar uma tarefa com computer use? Como estimativa conservadora, uma tarefa simples de poucas telas costuma sair funcionando em algumas horas de configuração e teste. Tarefa com muitas telas ou lógica condicional (decidir o próximo passo dependendo do que aparece) leva mais tempo de ajuste, geralmente alguns dias até ficar estável o suficiente pra rodar com supervisão mais leve.
Preciso de time técnico pra implementar computer use na minha empresa? Ajuda ter alguém que saiba escrever instrução clara e testar o resultado, mas não precisa de um time de desenvolvimento completo. A parte mais técnica é decidir o escopo certo de acesso, ou seja, o que o agente pode e não pode fazer, e revisar o comportamento nos primeiros dias de uso. Depois de estável, a manutenção parece com a de qualquer outra automação: ajustar quando o sistema alvo muda de tela.
Computer use funciona em ERP brasileiro antigo, tipo sistema em Delphi ou terminal? Funciona, e é justamente o cenário onde computer use ganha mais sentido, porque esse tipo de sistema quase nunca tem API documentada. O agente enxerga a tela do jeito que ela é renderizada, então terminal, aplicação desktop antiga ou sistema web de anos atrás entram como qualquer outra tela. O ponto de atenção é a estabilidade da conexão remota, se o acesso é via Citrix ou área de trabalho remota, e a resolução da tela, porque texto pequeno demais aumenta a chance de erro.
Computer use não é a próxima moda, é uma ferramenta a mais na caixa: útil pro sistema que ninguém nunca vai integrar de verdade, arriscado demais pra escrita crítica sem revisão. Vale mapear qual sistema seu se encaixa em qual caso antes de colocar um agente pra clicar sozinho.
Quer ver onde a IA te devolve tempo na sua empresa?
Faço um mapeamento gratuito do seu dia a dia e mostro os processos que já dá pra tirar das suas costas com IA.
Fazer o mapeamento gratuito Ou me acompanhe no Instagram: @ericluciano