O nome da categoria já entrega a diferença: a Laya é um modelo de decisão não autorregressivo. Ele não escreve texto. Você entrega um estado (um e-mail, um chamado de suporte, um registro de agente, um JSON) e ele devolve uma decisão estruturada com probabilidades. Sem prosa, sem alucinação de formato: escolhas entre opções predefinidas, pontuações em escalas ordenadas ou booleanos com probabilidade associada.
Como é feito (e por que isso importa no custo)
Por baixo: um codificador bidirecional baseado no ModernBERT-large, com cerca de 395 milhões de parâmetros no codificador (421 milhões no checkpoint completo) combinados com uma cabeça de decisão de duas camadas. Os pesos publicados somam menos de 1 GB, com contexto de 512 tokens (variantes chegam a 1.024). Traduzindo para hardware: roda em GPU de entrada, e a inferência de uma decisão curta leva dezenas de milissegundos numa Tesla T4. Uma implementação comunitária para Apple Silicon (Laya-MLX) reporta 13,4 ms por decisão em inglês e 7,4 ms em multilíngue num M3 Max. Compare com a chamada a um LLM de fronteira: custo por token, latência de segundos, e a necessidade de parsear a resposta na esperança de que venha no formato pedido.
Os três tipos de saída cobrem a maioria das decisões de operação: escolha (probabilidade entre opções predefinidas: faturamento, suporte ou vendas), pontuação (valor numa escala ordenada: urgência de 0 a 4) e bool (probabilidade de verdadeiro: "este e-mail é phishing?").
Treinamento por RLCD: o detalhe que separa sinal de ruído
A Laya foi treinada com RLCD (Aprendizagem por Reforço para Decisões Calibradas): o objetivo não é só acertar, é calibrar a confiança. Esse detalhe é o que permite o padrão de uso mais valioso: usar a confiança da decisão para decidir se você escala. Uma decisão com confiança baixa vai para revisão humana ou para um modelo maior; a de confiança alta, executa direto. O próprio projeto recomenda recalibrar no domínio de implantação: a calibração do modelo base não substitui a afinação no seu dado.
No benchmark público de decisões tipadas: aleatório marca cerca de 0,318; a Laya base sem exemplos, cerca de 0,36; a Laya com afinação específica no domínio, cerca de 0,766. A leitura do próprio material: a especialização importa mais que o modelo base. Ou seja: não existe "decisor universal". Existe o decisor afinado para a sua operação, e o trabalho real está no dado de treino: os seus e-mails, os seus encaminhamentos, os seus casos resolvidos.
As limitações declaradas (leia antes de sonhar)
O projeto é honesto sobre onde não funciona: não elimina decisões erradas, apenas respostas inválidas (JSON malformado, opções inventadas: o tipo de erro de LLM que derruba automações); espaços de rótulos grandes degradam o desempenho (recomendação: menos de cerca de 20 opções, ou roteamento hierárquico); pontuação ordinal é mais fraca que escolha categórica; e o contexto curto pede evidências selecionadas, não documentos inteiros. É um instrumento de precisão para decisões curtas, não um cérebro geral.
Onde cabe na arquitetura (a camada que faltava)
O encaixe mais útil é a arquitetura em camadas: regras e código para o determinístico; modelo de decisão local para as avaliações repetitivas de médio risco; modelo de raciocínio grande para o ambíguo; modelo generativo para criar linguagem; e uma camada de política definindo o que pode executar. A Laya funciona como filtro local barato antes de escalar: triagem de e-mails, encaminhamento de agentes, moderação, detecção de intenção, barreiras de segurança e roteamento em workflows. Para operações brasileiras, há um benefício adicional: o dado não sai da sua infraestrutura, o que simplifica a conversa com LGPD, e o custo por decisão é o da sua GPU, não da fatura da API.
Como começar (e o que medir antes)
1. Mapeie as decisões repetitivas da sua operação: onde o mesmo julgamento acontece centenas de vezes por dia? 2. Confirme o critério de adequação: o espaço de respostas válidas é conhecido antes da execução? 3. Separe o histórico de decisões corretas: é o dado de afinação. 4. Pilote com escala por confiança: decisão confiante executa, insegura escala. 5. Meça o que importa: acerto, escalonamento e o custo por decisão comparado ao processo atual. Para ver o mesmo conceito do lado do serviço gerenciado, o guia do JEV e os 7 casos de decisão tipada complementa; e para os agentes que recebem essas decisões, o panorama da era agêntica.