Serviços Blog Cases Glossário Soluções Ferramentas Contato Consultoria Gratuita

Inteligência Artificial

Laya: o modelo de decisão open source que roda no seu computador

22/09/2026 10 min de leitura Por Equipe M&C

Existe uma camada da automação que os grandes modelos de linguagem atendem mal e caro: a decisão repetitiva e estruturada. Encaminhar este e-mail para vendas ou suporte? Qual a urgência deste chamado (0 a 4)? Este registro é phishing? Um LLM responde com prosa cara e lenta; uma regra if/else não lê contexto. A Laya, modelo de decisão open source lançado pela Convai Innovations, ocupa exatamente esse vazio: pesos abertos sob Apache 2.0, menos de 1 GB, decisões tipadas em dezenas de milissegundos rodando no seu próprio hardware. Este guia explica como ela funciona, o que decide bem, onde erra e onde cabe na arquitetura de uma operação brasileira.

O nome da categoria já entrega a diferença: a Laya é um modelo de decisão não autorregressivo. Ele não escreve texto. Você entrega um estado (um e-mail, um chamado de suporte, um registro de agente, um JSON) e ele devolve uma decisão estruturada com probabilidades. Sem prosa, sem alucinação de formato: escolhas entre opções predefinidas, pontuações em escalas ordenadas ou booleanos com probabilidade associada.

Como é feito (e por que isso importa no custo)

Por baixo: um codificador bidirecional baseado no ModernBERT-large, com cerca de 395 milhões de parâmetros no codificador (421 milhões no checkpoint completo) combinados com uma cabeça de decisão de duas camadas. Os pesos publicados somam menos de 1 GB, com contexto de 512 tokens (variantes chegam a 1.024). Traduzindo para hardware: roda em GPU de entrada, e a inferência de uma decisão curta leva dezenas de milissegundos numa Tesla T4. Uma implementação comunitária para Apple Silicon (Laya-MLX) reporta 13,4 ms por decisão em inglês e 7,4 ms em multilíngue num M3 Max. Compare com a chamada a um LLM de fronteira: custo por token, latência de segundos, e a necessidade de parsear a resposta na esperança de que venha no formato pedido.

Os três tipos de saída cobrem a maioria das decisões de operação: escolha (probabilidade entre opções predefinidas: faturamento, suporte ou vendas), pontuação (valor numa escala ordenada: urgência de 0 a 4) e bool (probabilidade de verdadeiro: "este e-mail é phishing?").

Treinamento por RLCD: o detalhe que separa sinal de ruído

A Laya foi treinada com RLCD (Aprendizagem por Reforço para Decisões Calibradas): o objetivo não é só acertar, é calibrar a confiança. Esse detalhe é o que permite o padrão de uso mais valioso: usar a confiança da decisão para decidir se você escala. Uma decisão com confiança baixa vai para revisão humana ou para um modelo maior; a de confiança alta, executa direto. O próprio projeto recomenda recalibrar no domínio de implantação: a calibração do modelo base não substitui a afinação no seu dado.

O benchmark que honesta e publicamente diz "especialização importa"

No benchmark público de decisões tipadas: aleatório marca cerca de 0,318; a Laya base sem exemplos, cerca de 0,36; a Laya com afinação específica no domínio, cerca de 0,766. A leitura do próprio material: a especialização importa mais que o modelo base. Ou seja: não existe "decisor universal". Existe o decisor afinado para a sua operação, e o trabalho real está no dado de treino: os seus e-mails, os seus encaminhamentos, os seus casos resolvidos.

As limitações declaradas (leia antes de sonhar)

O projeto é honesto sobre onde não funciona: não elimina decisões erradas, apenas respostas inválidas (JSON malformado, opções inventadas: o tipo de erro de LLM que derruba automações); espaços de rótulos grandes degradam o desempenho (recomendação: menos de cerca de 20 opções, ou roteamento hierárquico); pontuação ordinal é mais fraca que escolha categórica; e o contexto curto pede evidências selecionadas, não documentos inteiros. É um instrumento de precisão para decisões curtas, não um cérebro geral.

Onde cabe na arquitetura (a camada que faltava)

O encaixe mais útil é a arquitetura em camadas: regras e código para o determinístico; modelo de decisão local para as avaliações repetitivas de médio risco; modelo de raciocínio grande para o ambíguo; modelo generativo para criar linguagem; e uma camada de política definindo o que pode executar. A Laya funciona como filtro local barato antes de escalar: triagem de e-mails, encaminhamento de agentes, moderação, detecção de intenção, barreiras de segurança e roteamento em workflows. Para operações brasileiras, há um benefício adicional: o dado não sai da sua infraestrutura, o que simplifica a conversa com LGPD, e o custo por decisão é o da sua GPU, não da fatura da API.

Como começar (e o que medir antes)

1. Mapeie as decisões repetitivas da sua operação: onde o mesmo julgamento acontece centenas de vezes por dia? 2. Confirme o critério de adequação: o espaço de respostas válidas é conhecido antes da execução? 3. Separe o histórico de decisões corretas: é o dado de afinação. 4. Pilote com escala por confiança: decisão confiante executa, insegura escala. 5. Meça o que importa: acerto, escalonamento e o custo por decisão comparado ao processo atual. Para ver o mesmo conceito do lado do serviço gerenciado, o guia do JEV e os 7 casos de decisão tipada complementa; e para os agentes que recebem essas decisões, o panorama da era agêntica.

Perguntas frequentes

Dúvidas rápidas

O que é a Laya?
É um modelo de decisão não autorregressivo de pesos abertos (Apache 2.0) da Convai Innovations. Diferente de um LLM, não gera texto: recebe um estado (e-mail, chamado, JSON) e devolve decisões estruturadas com probabilidades: escolha entre opções, pontuação em escala ou booleano. Pesa menos de 1 GB e roda localmente.
A Laya substitui um LLM?
Não: são camadas diferentes. O LLM raciocina sobre problemas ambíguos e gera linguagem; a Laya decide entre opções conhecidas com rapidez e custo por decisão irrisórios. A arquitetura recomendada combina os dois: a Laya como filtro local para as decisões repetitivas, escalando para o modelo grande o que a confiança indicar.
Quanto custa rodar a Laya?
Os pesos são gratuitos (Apache 2.0) e a execução é no seu hardware: uma GPU de entrada já atende, com decisões em dezenas de milissegundos numa Tesla T4. Os custos reais são o hardware, a afinação no seu domínio (o benchmark público mostra que a especialização é o que eleva a precisão) e a manutenção da esteira de dados.
A Laya funciona com português?
O checkpoint base é treinado em inglês, com variantes multilíngues e contexto de até 1.024 tokens. Para uso em português com máxima precisão, o caminho recomendado pelo projeto é a afinação no domínio: treinar com as decisões da sua operação, em português, o que também resolve a calibração local.
Quais decisões a Laya decide bem?
As com espaço de respostas conhecido antes da execução e julgamento repetitivo: encaminhamento de agentes, triagem de e-mails, moderação, detecção de intenção, barreiras de segurança e roteamento em workflows. Limites declarados: menos de cerca de 20 opções por decisão, pontuação ordinal mais fraca que categórica e contexto curto.

Automatize as decisões repetitivas do seu negócio

A M&C estrutura agentes de IA que qualificam, encaminham e agendam. Conheça o serviço.

Continue lendo

Leia também

Fale conosco no WhatsApp