O que é o Hetzner Inference
O Hetzner Inference e a nova plataforma de inferência de inteligência artificial da Hetzner, empresa alemã conhecida por oferecer servidores e VPS a preços muito abaixo dos concorrentes como AWS, Azure e Google Cloud. Lançada em 2026, a plataforma permite rodar modelos de linguagem e outros modelos de IA em GPUs dedicadas sem precisar configurar infraestrutura própria.
Para quem trabalha com desenvolvimento de software e não quer depender exclusivamente das APIs de OpenAI ou Anthropic, o Hetzner Inference aparece como uma alternativa de custo controlado para hospedar modelos open-weight como Llama 3, Mistral, Qwen ou modelos de embedding como nomic-embed-text. A proposta e simples: mesmo hardware de qualidade, preço europeu competitivo.
A Hetzner já tem reputação solida entre devs europeus e brasileiros por seus servidores dedicados e VPS baratos. Trazer isso para o mundo de inferência de IA e uma extensão natural de como eles operam: infraestrutura sem frescura, sem tier de marketing inflado.
Como funciona
O Hetzner Inference oferece um endpoint de API compatível com o formato de API da OpenAI, o que significa que você pode usar a maioria das SDKs e ferramentas que já funcionam com GPT-4 ou outros modelos OpenAI, apenas trocando a base URL e o modelo. A compatibilidade com o formato /v1/chat/completions facilita muito a migração ou o uso paralelo.
Por baixo, a Hetzner roda os modelos em GPUs de alta performance em seus data centers europeus (principalmente Nuremberg e Helsinki). O serviço funciona no modelo pay-per-token: você paga pelo que usa, sem comprometimento mensal mínimo.
Para desenvolvimento local e experimentos, o Hetzner Inference pode ser combinado com ferramentas como LiteLLM ou OpenRouter para criar um gateway unificado que distribui chamadas entre diferentes provedores conforme custo e disponibilidade.
Se você já usa o cliente Python da OpenAI, migrar para o Hetzner Inference e mudar duas linhas: o base_url e o model. O resto do código fica idêntico.
Principais recursos
O Hetzner Inference entrega um conjunto solido para quem quer inferência de IA sem complexidade excessiva:
- Compatibilidade OpenAI API: drop-in replacement para a maioria dos casos de uso, sem reescrever integrações
- Modelos open-weight populares: Llama 3, Mistral, modelos de embedding - sem depender de modelos fechados
- Pay-per-token: sem comprometimento de instância ou pagar por GPU ociosa
- Data centers europeus: vantagem de latência para usuários na Europa e no Brasil comparado com us-east-1
- Preços competitivos: historicamente a Hetzner prática preço abaixo do mercado para infra equivalente
A plataforma também permite criar instâncias dedicadas de GPU para workloads que precisam de throughput alto e latência consistente, diferente do modelo serverless de inferência compartilhada.
O Hetzner Inference ainda e relativamente novo e o catalogo de modelos disponível e menor do que o de plataformas como Together AI ou Replicate. Verifique se o modelo que você precisa esta disponível antes de planejar uma migração.
Como começar: acesso passo a passo
Para começar a usar o Hetzner Inference, você precisa de uma conta Hetzner. Se já tem um servidor ou VPS deles, a mesma conta funciona.
# 1. Criar conta em console.hetzner.com
# 2. Acessar a secao Inference na Cloud Console
# 3. Gerar uma API Key na secao de tokens
# 4. Testar via curl
curl https://api.hetzner.cloud/inference/v1/chat/completions \
-H "Authorization: Bearer SEU_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"model": "meta-llama/Meta-Llama-3.1-8B-Instruct",
"messages": [{"role": "user", "content": "Ola! Qual e a capital do Brasil?"}]
}'Para usar com o SDK Python da OpenAI, a mudança e mínima:
pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://api.hetzner.cloud/inference/v1",
api_key="SEU_HETZNER_TOKEN"
)
resposta = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "Explique o que é RAG em 3 frases"}]
)
print(resposta.choices[0].message.content)Exemplo prático: RAG simples com Hetzner Inference
Um caso de uso concreto e construir um sistema de RAG (Retrieval-Augmented Generation) para responder perguntas sobre documentos internos. Com o Hetzner Inference, você pode rodar tanto o modelo de embedding quanto o modelo de geração no mesmo provedor:
from openai import OpenAI
client = OpenAI(
base_url="https://api.hetzner.cloud/inference/v1",
api_key="SEU_TOKEN"
)
# 1. Gerar embedding do documento
embedding = client.embeddings.create(
model="nomic-ai/nomic-embed-text-v1.5",
input="Texto do documento a ser indexado"
)
vector = embedding.data[0].embedding
# 2. Buscar no vector store e gerar resposta
contexto = buscar_no_vector_store(vector)
resposta = client.chat.completions.create(
model="meta-llama/Meta-Llama-3.1-70B-Instruct",
messages=[
{"role": "system", "content": f"Contexto: {contexto}"},
{"role": "user", "content": "Qual e a política de ferias da empresa?"}
]
)Todo o pipeline roda em infraestrutura europeia da Hetzner, com controle total sobre quais dados saem da sua aplicação e para qual provedor.
Comparação com alternativas
O mercado de inferência de IA em nuvem esta cheio de opcoes. Onde o Hetzner se posiciona:
vs. OpenAI API: a OpenAI tem os modelos mais capazes (GPT-4o, o1), mas preço mais alto e modelos fechados. O Hetzner oferece modelos open-weight com preço potencialmente menor e sem lockin de modelo.
vs. Together AI / Replicate: ambos oferecem catalogo maior de modelos open-source. O Hetzner pode ganhar em preço e latência para usuários europeus, mas perde em variedade de modelos por enquanto.
vs. self-hosted Ollama: Ollama na sua VPS Hetzner e a opcao mais barata para volume alto, mas exige gerenciamento da instância, das atualizações e do scaling. O Hetzner Inference abstrai tudo isso.
vs. AWS Bedrock / Azure OpenAI: AWS e Azure tem ecossistema mais amplo e integrações corporativas, mas preço e complexidade são significativamente maiores. Para startups e projetos independentes, o Hetzner e mais acessível.
Pontos positivos e limitações
O Hetzner Inference tem pontos fortes claros para o público certo: preço competitivo, compatibilidade com API OpenAI e a reputação de confiabilidade da Hetzner em infraestrutura. Para equipes europeias com requisitos de residência de dados, ter os servidores na Alemanha ou Finlândia e um diferencial relevante para conformidade com GDPR.
As limitações são reais neste momento:
- Catalogo de modelos ainda menor que concorrentes especializados em inferência
- Documentação em fase inicial, menos exemplos e tutoriais que AWS ou Azure
- Modelos de ponta como GPT-4o ou Claude Opus não estão disponíveis (eles são fechados)
- Suporte e SLA ainda não tao maduros quanto os hiperescaladores para uso enterprise
Para projetos que precisam de fallback entre provedores, use o LiteLLM como proxy. Você configura Hetzner como provedor primário por custo e OpenAI como fallback, com roteamento automático quando o modelo não esta disponível.
Casos de uso reais
Startups de software com usuários europeus: requisitos de GDPR ficam mais simples quando os dados processados ficam em servidores na Alemanha ou Finlândia. O Hetzner Inference permite cumprir a regulamentação sem pagar premium por isso.
Desenvolvedores independentes e freelancers: API económica para adicionar funcionalidades de IA a projetos sem comprometimento mensal mínimo. Paga apenas pelo que usa.
Equipes que querem evitar lockin: como a API e compatível com OpenAI, e fácil testar o Hetzner em paralelo com outros provedores e migrar conforme necessidade, sem reescrever a integração.
Projetos de RAG e embeddings: ter modelo de embedding e modelo de geração no mesmo provedor simplifica a arquitetura e o billing de um pipeline completo de RAG.
Dicas e boas práticas
Comece pelo modelo 8B para desenvolvimento e testes. Só escale para 70B quando a qualidade do 8B não for suficiente para o seu caso de uso. A diferença de custo e significativa.
Ative o streaming (parâmetro stream: true) para respostas longas. Melhora muito a percepção de velocidade na interface do usuário, mesmo que o tempo total de geração seja o mesmo.
Para volume alto de requisições, calcule se uma instância GPU dedicada na Hetzner (Cloud GPU) com Ollama não sai mais barato do que o modelo pay-per-token. Para mais de algumas centenas de milhares de tokens por dia, a conta pode fechar melhor com instância própria.
Monitore o uso de tokens ativamente, especialmente no inicio. Bugs em loops de agentic AI podem gerar volume inesperado de requisições. Configure alertas de billing desde o primeiro dia.
Vale a pena?
Para devs que já usam Hetzner e querem adicionar IA sem abrir nova conta em outro provedor: sim, faz muito sentido consolidar. A integração e simples e o billing fica centralizado.
Para equipes europeias com requisitos de GDPR: o Hetzner Inference oferece uma combinação difícil de encontrar: preço acessível com infraestrutura na Europa, sem depender dos termos de privacidade das big techs americanas.
Para quem esta avaliando hoje: o próximo passo e criar uma conta gratuita em console.hetzner.com, acessar a secao de Inference e fazer os primeiros testes com o modelo Llama 3 8B. O custo de experimentar e praticamente zero, e a compatibilidade com a API da OpenAI garante que você não precisa de nenhuma mudança no seu código existente para testar.
Comentários
Deixar um comentárioVocê precisa ter uma conta no Do Zero ao Junior para comentar.