
A transformação digital dos serviços governamentais deu um salto expressivo com a recente reestruturação da plataforma de Inteligência Artificial desenvolvido e mantido pelo Laboratório de Inovação Goiás (LIGO), hospedado no DATACENTER do Estado (GO Cloud). Por meio da combinação de aceleradores gráficos NVIDIA A100, orquestração em Red Hat OpenShift AI e a engine de inferência vLLM, a equipe técnica superou gargalos históricos de concorrência e transformou o ecossistema de modelos de linguagem (LLMs) em uma estrutura de alto rendimento para toda a administração pública.
O Desafio da Concorrência e a Solução de Engenharia
No modelo anterior, os modelos de IA operavam disputando frações da mesma placa de vídeo (45% de VRAM para cada). Com o aumento da demanda em testes de 50 usuários simultâneos, a memória temporária de atendimento (KV Cache) se esgotava, gerando longas filas de espera que chegavam a mais de um minuto por resposta.
Para resolver o problema em definitivo, a arquitetura foi redesenhada:
- Dedicação Exclusiva de GPU: O modelo de maior demanda conversacional (Qwen3 8B) recebeu uma GPU A100 dedicada com 95% de aproveitamento de VRAM.
- Processamento Fracionado (Chunked Prefill): O sistema passou a fatiar prompts longos em blocos, impedindo que textos extensos travassem as respostas de outros usuários.
- Ajuste Fino de Paralelismo: Otimização dos parâmetros de lote contínuo (Continuous Batching) para o Llama 3.1 8B e Qwen3 8B.
Desempenho Comprovado: De Minutos para Milissegundos
Os testes com 100 usuários simultâneos (o dobro da carga inicial) atestaram uma evolução drástica nos indicadores de desempenho:
| Modelo Analisado | Cenário de Uso | Tempo até o 1º Token (TTFT) | Vazão (Requisições/s) | Ganho de Eficiência |
| Qwen3 8B | Antes (Legado) | 64,6 segundos | 0,40 req/s | Linha de base |
| Qwen3 8B | Depois (Otimizado) | 0,20 segundo (207 ms) | 4,00 req/s | +900% de vazão / -99,7% de espera |
| Llama 3.1 8B | Antes (Legado) | 43,5 segundos | 0,60 req/s | Linha de base |
| Llama 3.1 8B | Depois (Otimizado) | 15,4 segundos | 3,50 req/s | +483% de vazão / -64,4% de espera |


Teste de Estresse Extremo com 250 Usuários Concorrentes
Para simular situações reais de alta demanda — como o lançamento de programas sociais ou abertura de inscrições públicas —, o Qwen3 8B foi colocado à prova com 250 usuários conectados simultaneamente.
| Parâmetro Avaliado | Comportamento sob 250 Usuários |
| Taxa de Confiabilidade | 100% de entregas bem-sucedidas (0 exceções e 0 falhas) |
| Tempo até Iniciar Resposta | 320 ms (mediana) e 490 ms (média) |
| Vazão Sustentada | 4,20 requisições por segundo ininterruptas |
O resultado confirma que o ambiente absorve picos severos de uso mantendo respostas quase imperceptíveis ao usuário final.

Aplicações Práticas nos Serviços Públicos
A nova infraestrutura viabiliza a integração imediata de IA generativa em diversas frentes da administração:
| Serviço / Aplicação | Modelo Empregado | Benefício Direto |
| Atendimento ao Cidadão (Chatbots) | Qwen3 8B (A100 Dedicada) | Conversação natural e imediata sem filas virtuais |
| Classificação e Triagem de Demandas | Llama 3.1 8B (vLLM Otimizado) | Automação e roteamento veloz de solicitações administrativas |
| Análise Documental e Pareceres | Qwen3 8B (Contexto 32k–128k) | Leitura e resumo de processos volumosos, editais e minutas jurídicas |
| Privacidade e Soberania de Dados | Cluster Interno OpenShift IA | Tratamento de informações sigilosas dentro do data center governamental |
Próximos Passos: Expansão Gradativa de Contexto
Com a capacidade confirmada nos registros do vLLM para suportar até 128.000 tokens (o equivalente a centenas de páginas em uma única consulta), a equipe técnica adotou uma estratégia de liberação progressiva: a operação inicia em 32.768 tokens para consolidar a estabilidade e avançará para volumes maiores conforme a demanda dos órgãos públicos.
Com essa entrega do LIGO, o Estado consolida sua posição de vanguarda no uso ético, seguro e de alta performance da Inteligência Artificial a serviço da sociedade.
Gostou? Deixe seu comentário aqui...