PT ▾
Obter chave de API

API Hermes: Alterne seu cliente em três linhas

Comece a usar a API Hermes em minutos usando SDKs padrão do OpenAI. Este guia rápido cobre configuração, solicitações básicas, streaming e tratamento de erros para sua integração de LLM sem censura.

por 1M tokens de entrada
$0.25
Tokens de saída / 1M
$1.00
janela de contexto de tokens
100,000
crédito de teste grátis
$0.50
solicitações por minuto
300

Instale o SDK do OpenAI

Como nosso endpoint é compatível com OpenAI, você pode usar os SDKs oficiais que já conhece. Essa abordagem permite que você mude de outros fornecedores sem reescrever a lógica do seu aplicativo. Suportamos o pacote padrão openai para ambientes Python e Node.js.

Certifique-se de estar usando uma versão recente do SDK para garantir compatibilidade com streaming e chamada de funções. A biblioteca do cliente lida com a serialização JSON e o transporte HTTP automaticamente, para que você possa focar nos parâmetros do modelo em vez dos detalhes da rede.

Configure URL Base e Chave

A autenticação é feita por meio de um token Bearer no cabeçalho Authorization. Você obtém sua chave inscrevendo-se com um e-mail e senha no nosso painel. Não é necessário cartão de crédito para o teste, e você pode regenerar sua chave a qualquer momento para revogar o acesso.

Defina a URL base para nosso endpoint dedicado. Isso garante que todas as solicitações sejam enviadas para nossa infraestrutura de modelo sem censura, em vez da nuvem padrão do OpenAI. Você pode encontrar sua chave de API na página 'Obter chave de API' imediatamente após o cadastro.

Envie sua primeira solicitação

Envie uma solicitação padrão de conclusão de chat para testar a conectividade. O ID do modelo é sempre uncensored. Este modelo é ajustado para responder sem recusas de conteúdo para uso adulto lícito, sendo ideal para escrita criativa, roleplay ou pesquisa sem restrições.

  • Use POST /v1/chat/completions para geração de texto.
  • A janela de contexto suporta até 100.000 tokens para prompt mais conclusão.
  • As solicitações são cobradas com base na contagem de tokens de entrada e saída.
curl https://api.hermesllmapi.com/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Ative o Streaming (SSE)

Para uma melhor experiência do usuário, ative o streaming para receber tokens conforme são gerados. Isso reduz a latência percebida, especialmente para respostas longas. O servidor retorna Eventos Enviados pelo Servidor (SSE) que seu cliente pode analisar em tempo real.

Defina o parâmetro stream como true no corpo da sua requisição. O SDK retornará blocos conforme chegam. Isso é especialmente útil para interfaces de chat onde você deseja exibir texto de forma incremental, em vez de aguardar o fim da resposta completa.

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Use chamada de funções

Nossa API suporta chamada de funções, permitindo que o modelo gere JSON estruturado para execução de ferramentas externas. Defina suas funções no parâmetro tools, e o modelo retornará tool_calls na resposta se for apropriado.

Este recurso funciona exatamente conforme documentado na especificação do OpenAI. Você pode analisar o nome da função e os argumentos, executar a lógica do seu backend e alimentar os resultados de volta na conversa. É totalmente compatível com fluxos de trabalho padrão de chamada de funções do SDK do OpenAI.

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.hermesllmapi.com/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Verifique os modelos disponíveis

Consulte o endpoint de modelos para verificar a conectividade e ver as opções disponíveis. Atualmente, oferecemos um único modelo dedicado: uncensored. Essa simplicidade evita a complexidade de roteamento de modelos ou infraestrutura genérica, garantindo comportamento previsível.

Você também pode usar este endpoint para depurar problemas de autenticação. Se a solicitação falhar, verifique a validade da sua chave de API e a conectividade de rede. A resposta listará os detalhes do modelo, incluindo o tamanho da janela de contexto e os limites de tokens.

from openai import OpenAI

client = OpenAI(base_url="https://api.hermesllmapi.com/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Gerencie limites de requisições e erros

Nossa API impõe um limite de 300 solicitações por minuto por chave. Se você exceder isso, receberá um erro 429. Também suportamos um limite de corpo de solicitação de 8 MB para prompts complexos ou janelas de contexto grandes.

Erros comuns incluem 401 (chave inválida) e 402 (crédito insuficiente). O crédito pré-pago nunca expira, então você pode recarregar quando quiser. Bônus de crédito são aplicados automaticamente para compras maiores: +5% a partir de $50 e +10% a partir de $100.

Especificações técnicas

Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.

ItemValor
Formatocompatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave
ID do modelouncensored
EndpointsPOST /v1/chat/completions · GET /v1/models
AutenticaçãoAuthorization: Bearer YOUR_KEY
Base URLhttps://api.hermesllmapi.com/v1
Saída máximaaté o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado)
Modo JSONresponse_format: {"type": "json_object"}
Parâmetrostemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Chamada de funçõessim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool
Janela de contexto100.000 tokens (entrada + saída)
Streamingsim — server-sent events; o último bloco traz o uso de tokens
Concorrência8 requisições ao mesmo tempo por chave
CabeçalhosX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Limite de taxa300 requisições por minuto por chave
Tamanhoaté 8 MB por requisição
Preço$0,25 por 1M tokens de entrada · $1,00 por 1M de saída
Bônus+5% a partir de $50, +10% a partir de $100
RecargaUSDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500
Teste grátis$0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga
Cobrançacrédito pré-pago pelo uso real; erros e recusas são grátis
Validadecrédito pago não expira, sem assinatura
Chavesuma chave ativa por conta; uma nova substitui a anterior
LoginGoogle ou e-mail e senha
Conteúdoconteúdo adulto permitido; conteúdo sexual com menores é recusado

Códigos de erro

Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.

CódigoTipoSignificado
400bad_requestJSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais
401missing_key · invalid_key · key_revokedchave ausente, errada ou substituída
402no_creditsem crédito — recarregue e continue na hora
403content_blockedconteúdo sexual com menores — recusado, sem cobrança
404not_foundendpoint desconhecido
413request_too_largecorpo acima de 8 MB
429rate_limited · concurrencyacima de 300/min ou 8 em paralelo — aguarde e tente de novo
503upstream_busymodelo ocupado — tente em alguns segundos
01

Perguntas e respostas

A API Hermes suporta geração de imagens ou áudio?

Não, oferecemos atualmente uma API de conclusões de chat apenas para texto. Não suportamos embeddings, geração de imagens, áudio ou vídeo, nem oferecemos ajuste fino. Nosso foco é fornecer um modelo de texto sem censura direto para clientes compatíveis com OpenAI.

Como o modelo sem censura lida com conteúdo adulto?

O modelo não recusa tópicos adultos lícitos, fictícios ou controversos. No entanto, há um limite rígido de conteúdo: solicitações envolvendo conteúdo sexual com menores são sempre bloqueadas. Esta é a única restrição estrita aplicada aos seus prompts.

O que acontece se eu ficar sem crédito?

Sua chave de API permanece ativa, mas as solicitações retornarão um erro 402 indicando fundos insuficientes. Você pode recarregar sua conta com criptomoedas (USDT ou USDC) a qualquer momento. Seu crédito pré-pago nunca expira, então você pode adicionar fundos quando estiver pronto para continuar.

Sua chave está a um formulário de distância

Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.

Obter chave de APILer a documentação