O que é o Ollaya
O Ollaya e um projeto open-source que surgiu como wrapper em cima do Ollama, com um foco bem específico: facilitar o uso de modelos de decisão estruturada no estilo Jev diretamente na sua máquina local. Em vez de mandar chamadas para APIs externas pagas, você roda tudo localmente, com controle total sobre os dados e sem custo por token.
O conceito de modelos Jev (abreviação de um padrão de raciocínio encadeado) e relativamente recente no mundo dos LLMs open-source. A ideia e estruturar a saída do modelo de forma que ele tome decisões passo a passo, verificando condições antes de executar ações. Isso e especialmente útil para agentes autónomos, workflows de automação e sistemas que precisam de comportamento previsível.
O Ollaya chegou ao radar da comunidade dev em setembro de 2026, quando foi destaque no Hacker News com mais de 500 pontos. O interesse reflete uma tendência maior: cada vez mais devs querem usar LLMs locais para tarefas serias, não só para chat.
Como funciona
A arquitetura do Ollaya e relativamente simples. Ele atua como uma camada intermediaria entre o seu código e o Ollama, adicionando estrutura ao fluxo de prompts e respostas. Quando você faz uma chamada via Ollaya, ele envia o prompt para o modelo carregado no Ollama, interpreta a saída e aplica a lógica de decisão configurada antes de retornar o resultado para a sua aplicação.
O estilo Jev de decisão funciona como uma máquina de estados simplificada: o modelo avalia uma condição, escolhe um caminho e executa a ação correspondente. Em vez de um output livre e imprevisível, você obtem respostas estruturadas com opcoes bem definidas. Isso facilita muito a integração em sistemas reais, onde você precisa tratar a resposta de forma programática.
Por baixo dos panos, o Ollaya usa a API HTTP local do Ollama (por padrão em localhost:11434) e adiciona uma camada de orquestração por cima. Você não precisa modificar o Ollama em si, só instalar o wrapper e configurar seu pipeline de decisão.
O Ollama precisa estar rodando antes de iniciar o Ollaya. Certifique-se de que o serviço esta ativo com ollama serve antes de fazer qualquer chamada.
Principais recursos
O Ollaya reúne alguns recursos que o tornam interessante para devs que trabalham com automação e agentes de IA:
- Decision trees via prompts: defina árvores de decisão diretamente na configuração, sem precisar tratar strings manualmente no seu código.
- Compatibilidade total com Ollama: funciona com qualquer modelo disponível no Ollama, incluindo Llama 3, Mistral, Gemma, Phi-3 e outros modelos open-source.
- Output estruturado: respostas em formato JSON ou em esquemas definidos por você, prontos para consumo programático.
- Zero dependência de nuvem: tudo roda localmente. Seus dados de entrada e saída nunca saem da sua máquina.
- API HTTP simples: interface REST compatível com o padrão que muitos devs já conhecem do Ollama.
A combinação de rodar localmente com outputs estruturados e o ponto forte do Ollaya. Você ganha previsibilidade sem abrir mao da flexibilidade dos modelos open-source.
Como começar: instalação passo a passo
Antes de tudo, você precisa ter o Ollama instalado e funcionando. Se ainda não tem, acesse ollama.com e siga o guia de instalação para o seu sistema operacional (disponível para Linux, macOS e Windows).
Com o Ollama rodando, o próximo passo e instalar o Ollaya. O projeto esta disponível no GitHub e pode ser instalado via pip ou executado diretamente do repositório:
# Instalar via pip
pip install ollaya
# Ou clonar o repositório
git clone https://GitHub.com/ollaya-dev/ollaya
cd ollaya
pip install -e .Após a instalação, verifique se o Ollama esta rodando e inicie o Ollaya:
# Verificar se Ollama esta ativo
curl http://localhost:11434/api/tags
# Iniciar o Ollaya
ollaya start --model llama3.2O Ollaya exige Python 3.10 ou superior. Verifique sua versão com Python --version antes de instalar.
Exemplo prático
Imagine que você quer classificar tickets de suporte automaticamente por nível de urgência (baixo, médio, alto) sem enviar os dados para uma API externa. Com o Ollaya, você configura o pipeline de decisão e faz a chamada:
from ollaya import DecisionAgent
agent = DecisionAgent(
model="llama3.2",
options=["baixo", "médio", "alto"]
)
ticket = "O servidor de produção caiu e os usuários não conseguem logar."
result = agent.decide(ticket)
print(result.choice) # "alto"
print(result.reasoning) # explicação do raciocínio do modeloO retorno já vem estruturado com a opcao escolhida e o raciocínio por trás da decisão. Você pode usar result.choice diretamente no seu sistema sem precisar parsear texto livre.
Para casos mais complexos, você pode encadear múltiplos agentes de decisão, onde a saída de um alimenta a entrada do próximo. Esse padrão e muito útil em workflows de triagem, moderação de conteúdo e sistemas de recomendação locais.
Comparação com alternativas
O espaço de ferramentas para LLMs locais cresceu bastante. As principais alternativas ao Ollaya são:
- LangChain + Ollama: muito mais completo e maduro, mas com uma curva de aprendizado grande. Bom para projetos complexos, pesado para casos simples.
- LlamaIndex: focado em RAG (retrieval-augmented generation), excelente para busca semântica em documentos. Não e o foco do Ollaya.
- Ollama direto: simples e rápido, mas sem estruturação de output. Você trata tudo manualmente.
- GPT-4 / Claude via API: muito mais poderosos, mas com custo por token e dados saindo da sua máquina.
O Ollaya ocupa um nicho específico: você quer decisões estruturadas com LLMs locais e não quer a complexidade do LangChain. Se esse e o seu caso, o Ollaya faz sentido.
Para decisões mais acuradas, use modelos menores e mais rápidos (como Phi-3 mini ou Gemma 2B) com o Ollaya em produção. Modelos grandes são mais lentos e o ganho de qualidade para decisões binárias ou ternarias costuma ser marginal.
Pontos positivos e limitações
Os pontos fortes do Ollaya são claros: privacidade total, sem custo de API e outputs previsivies para integração em sistemas. Para times que precisam processar dados sensíveis ou que tem budget limitado para LLMs em produção, essa combinação e muito atraente.
As limitações existem e precisam ser consideradas. Primeiro, a qualidade do raciocínio depende diretamente do modelo escolhido e do hardware disponível. Modelos menores podem errar em casos ambíguos. Segundo, o projeto ainda e jovem (lançado em 2026), então a documentação e a estabilidade da API podem mudar.
Outro ponto de atenção: para tarefas que exigem conhecimento muito atualizado ou raciocínio muito complexo, modelos locais ainda ficam abaixo de GPT-4 ou Claude. O Ollaya não muda isso, só facilita o uso do que já esta disponível localmente.
Não use o Ollaya (nem LLMs locais em geral) para decisões críticas sem validação humana. A acuracia depende do modelo e dos dados de entrada, e falhas silenciosas podem acontecer.
Casos de uso reais
O Ollaya e mais útil em alguns cenários específicos:
- Classificação de dados sensíveis: empresas que não podem enviar dados de clientes para APIs externas podem usar o Ollaya para classificar, rotular ou triagear informações internamente.
- Automação de workflows internos: times de engenharia podem criar agentes de decisão para triagear pull requests, classificar bugs por severidade ou rotear tickets de suporte.
- Prototipação rápida de agentes: em vez de montar um stack completo com LangChain, o Ollaya oferece um caminho mais curto para testar a viabilidade de um agente de decisão antes de investir mais.
- Ambientes sem internet: sistemas embarcados, máquinas industriais ou ambientes de alta segurança onde o acesso externo e restrito se beneficiam de LLMs e wrappers que funcionam completamente offline.
Dicas e boas práticas
Comece com poucos choices (2 a 3 opcoes). Modelos menores performam muito melhor em decisões binárias do que em classificações com 10+ categorias.
Use o campo reasoning do resultado para logar o raciocínio do modelo. Isso facilita muito o debug quando o modelo toma uma decisão inesperada.
Faca fine-tuning ou use few-shot examples no seu prompt para o domínio específico do seu problema. LLMs genéricos erram mais em domínios técnicos sem exemplos de contexto.
Monitore o tempo de resposta em produção. Modelos locais podem ter latência varivel dependendo da carga da CPU/GPU. Defina timeouts adequados no seu cliente.
Vale a pena?
O Ollaya vale a pena para devs que já usam Ollama e querem adicionar lógica de decisão estruturada sem depender de APIs externas. Se você tem um caso de uso claro (classificação, triagem, roteamento) e precisa de privacidade ou controle de custos, o wrapper faz o trabalho de forma limpa.
Se você esta começando com LLMs agora, talvez valha a pena explorar primeiro o Ollama puro e o LangChain para entender o ecossistema antes de ir para wrappers mais especializados como o Ollaya.
O próximo passo recomendado: instale o Ollama, baixe um modelo leve (Phi-3 mini roda em máquinas com 8GB de RAM) e teste o Ollaya com um caso de uso simples do seu dia a dia. Você vai sentir rapidamente se o estilo Jev de decisão resolve o seu problema.
Comentários