Modernização Digital: Como a Otimização de Inteligência Artificial Reduziu o Tempo de Resposta em 99% na Arquitetura de IA do Estado Mantida pelo LIGO

03/09/2026
4 min
Inteligência Artificial, Publicações Ligo
27 curtidas
Ouvir
Navegue por Tópicos
Compartilhe
  • Comentar
Ouvir

A transformação digital dos serviços governamentais deu um salto expressivo com a recente reestruturação da plataforma de Inteligência Artificial desenvolvido e mantido pelo Laboratório de Inovação Goiás (LIGO), hospedado no DATACENTER do Estado (GO Cloud). Por meio da combinação de aceleradores gráficos NVIDIA A100, orquestração em Red Hat OpenShift AI e a engine de inferência vLLM, a equipe técnica superou gargalos históricos de concorrência e transformou o ecossistema de modelos de linguagem (LLMs) em uma estrutura de alto rendimento para toda a administração pública.


O Desafio da Concorrência e a Solução de Engenharia

No modelo anterior, os modelos de IA operavam disputando frações da mesma placa de vídeo (45% de VRAM para cada). Com o aumento da demanda em testes de 50 usuários simultâneos, a memória temporária de atendimento (KV Cache) se esgotava, gerando longas filas de espera que chegavam a mais de um minuto por resposta.

Para resolver o problema em definitivo, a arquitetura foi redesenhada:

  1. Dedicação Exclusiva de GPU: O modelo de maior demanda conversacional (Qwen3 8B) recebeu uma GPU A100 dedicada com 95% de aproveitamento de VRAM.
  2. Processamento Fracionado (Chunked Prefill): O sistema passou a fatiar prompts longos em blocos, impedindo que textos extensos travassem as respostas de outros usuários.
  3. Ajuste Fino de Paralelismo: Otimização dos parâmetros de lote contínuo (Continuous Batching) para o Llama 3.1 8B e Qwen3 8B.

Desempenho Comprovado: De Minutos para Milissegundos

Os testes com 100 usuários simultâneos (o dobro da carga inicial) atestaram uma evolução drástica nos indicadores de desempenho:

Modelo AnalisadoCenário de UsoTempo até o 1º Token (TTFT)Vazão (Requisições/s)Ganho de Eficiência
Qwen3 8BAntes (Legado)64,6 segundos0,40 req/sLinha de base
Qwen3 8BDepois (Otimizado)0,20 segundo (207 ms)4,00 req/s+900% de vazão / -99,7% de espera
Llama 3.1 8BAntes (Legado)43,5 segundos0,60 req/sLinha de base
Llama 3.1 8BDepois (Otimizado)15,4 segundos3,50 req/s+483% de vazão / -64,4% de espera
Redução drástica na latência de resposta inicial (TTFT), permitindo interação em tempo real.

Multiplicação da capacidade de atendimento contínuo mesmo com o dobro de usuários simultâneos.

Teste de Estresse Extremo com 250 Usuários Concorrentes

Para simular situações reais de alta demanda — como o lançamento de programas sociais ou abertura de inscrições públicas —, o Qwen3 8B foi colocado à prova com 250 usuários conectados simultaneamente.

Parâmetro AvaliadoComportamento sob 250 Usuários
Taxa de Confiabilidade100% de entregas bem-sucedidas (0 exceções e 0 falhas)
Tempo até Iniciar Resposta320 ms (mediana) e 490 ms (média)
Vazão Sustentada4,20 requisições por segundo ininterruptas

O resultado confirma que o ambiente absorve picos severos de uso mantendo respostas quase imperceptíveis ao usuário final.

Sustentação de estabilidade operacional e tempo submétrico com 50, 100 e 250 usuários conectados.

Aplicações Práticas nos Serviços Públicos

A nova infraestrutura viabiliza a integração imediata de IA generativa em diversas frentes da administração:

Serviço / AplicaçãoModelo EmpregadoBenefício Direto
Atendimento ao Cidadão (Chatbots)Qwen3 8B (A100 Dedicada)Conversação natural e imediata sem filas virtuais
Classificação e Triagem de DemandasLlama 3.1 8B (vLLM Otimizado)Automação e roteamento veloz de solicitações administrativas
Análise Documental e PareceresQwen3 8B (Contexto 32k–128k)Leitura e resumo de processos volumosos, editais e minutas jurídicas
Privacidade e Soberania de DadosCluster Interno OpenShift IATratamento de informações sigilosas dentro do data center governamental

Próximos Passos: Expansão Gradativa de Contexto

Com a capacidade confirmada nos registros do vLLM para suportar até 128.000 tokens (o equivalente a centenas de páginas em uma única consulta), a equipe técnica adotou uma estratégia de liberação progressiva: a operação inicia em 32.768 tokens para consolidar a estabilidade e avançará para volumes maiores conforme a demanda dos órgãos públicos.

Com essa entrega do LIGO, o Estado consolida sua posição de vanguarda no uso ético, seguro e de alta performance da Inteligência Artificial a serviço da sociedade.

Navegue por Tópicos
Compartilhe
  • Comentar

Adriano Pericles

Comentários mais recentes

Nenhum comentário encontrado.

Gostou? Deixe seu comentário aqui...