Atendimento / Q&A
Resumos, perguntas e respostas curtas, classificação de tickets. Volume alto de requisições, mas cada uma compacta. Ideal para SLM otimizado.
Pagamentos em dólar, variação cambial e tokens que explodem a fatura no fim do mês. O custo de LLMs públicas pode inviabilizar a escala da sua operação de IA. Descubra quanto sua empresa economiza rodando agentes em um Cloud Privado com SLMs otimizados.
Antes de calcular, é preciso entender que trabalhos de agentes de automação consomem exponencialmente mais tokens que tarefas gerais. Esses números variam por tipo de uso.
Resumos, perguntas e respostas curtas, classificação de tickets. Volume alto de requisições, mas cada uma compacta. Ideal para SLM otimizado.
Geração de código, ETL, queries SQL, análises de BI. Contexto técnico estruturado e respostas com lógica multi-passo.
SDR, BI conversacional, tool-calls múltiplos com RAG e raciocínio multi-turn. Cada passo do agente multiplica o consumo.
Ajuste os controles abaixo. O custo, a economia e o gráfico atualizam em tempo real conforme você muda volume e tier de operação.
Preço fixo por usuário/mês · GPU dedicada · vLLM · MDA LLM 2.1 (MoE FP8, 32B totais · 3,3B ativos · 256k contexto) · datacenter BR · SLA 99,5%.
Preço = usuários × preço/usuário/mês (com desconto linear por volume)
Lista (100 usuários): Básico R$ 103 · Intermediário R$ 107 · Avançado R$ 110
Floor (500+ usuários): R$ 89 em todos os tiers · desconto interpola linearmente entre 100 e 500.
Inclui infraestrutura GPU dedicada (80 Básico · 40 Intermediário · 15 Avançado usuários/GPU), operação, SLA e suporte. Operação comercial padrão (9h × 22 dias), fair-use policy.
Preços enterprise frontier 2026 · USD por 1M tokens · cobrança por uso real.
Tokens/mês = usuários × req/dia × tokens × 22 dias úteis
Custo = (in × $/1M_in + out × $/1M_out) × R$ 5/USD
o3 $20/$80 · Opus 4.7 $15/$75 · Gemini 2.5 Pro $2,50/$15 · Grok 4 $3/$15
Básico · 40 req · 200 in / 300 out (Q&A · busca)
Intermediário · 40 req · 2.500 in / 1.200 out (BI · coding)
Avançado · 25 req · 12.000 in / 2.500 out (agentes · multi-tool)
Comparamos a latência de modelos públicos (rota padrão EUA) vs nossa infraestrutura privada em datacenter no Brasil. Tempo até o primeiro token (TTFT).
Modelos tradicionais exigem clusters caríssimos. A arquitetura MoE (Mixture of Experts) do MDA LLM 2.1 ocupa uma fração da VRAM com a mesma qualidade — e ainda processa 256k tokens de contexto.
Fim da variação cambial e de contas em USD que dobram no fim do mês. Você paga em Reais, com custo fixo atrelado à sua infraestrutura. Previsibilidade orçamentária absoluta.
Seus dados nunca saem do Brasil. Stack roda em VPC privada (10.20.0.0/16) com proxies LiteLLM e engines vLLM isoladas. Audit logs imutáveis, RBAC, conformidade por design.
Não usamos modelos genéricos gigantes para tarefas específicas. Usamos a computação certa para o problema certo, aplicando fine-tuning e RAG com os dados da sua empresa.
Mudar de LLMs públicas para SLMs privados exige arquitetura, orquestração de dados e ajuste fino de quantização. Se seu time não tem bandwidth para isso, a Consultoria MDA faz por você.
Veja como o gasto de OPEX (operacional) se transforma em CAPEX inteligente (capacidade privada).
Você não está apenas trocando de fornecedor. Você está trocando o modelo econômico do consumo de IA.
Agende uma demonstração de 30 minutos. Você verá o LLM MDA 2.1 rodando em uma instância dedicada, com seus próprios casos de uso e benchmark ao vivo.