API Hermes: Alterne seu cliente em três linhas
Comece a usar a API Hermes em minutos usando SDKs padrão do OpenAI. Este guia rápido cobre configuração, solicitações básicas, streaming e tratamento de erros para sua integração de LLM sem censura.
- por 1M tokens de entrada
- $0.25
- Tokens de saída / 1M
- $1.00
- janela de contexto de tokens
- 100,000
- crédito de teste grátis
- $0.50
- solicitações por minuto
- 300
Instale o SDK do OpenAI
Como nosso endpoint é compatível com OpenAI, você pode usar os SDKs oficiais que já conhece. Essa abordagem permite que você mude de outros fornecedores sem reescrever a lógica do seu aplicativo. Suportamos o pacote padrão openai para ambientes Python e Node.js.
Certifique-se de estar usando uma versão recente do SDK para garantir compatibilidade com streaming e chamada de funções. A biblioteca do cliente lida com a serialização JSON e o transporte HTTP automaticamente, para que você possa focar nos parâmetros do modelo em vez dos detalhes da rede.
Configure URL Base e Chave
A autenticação é feita por meio de um token Bearer no cabeçalho Authorization. Você obtém sua chave inscrevendo-se com um e-mail e senha no nosso painel. Não é necessário cartão de crédito para o teste, e você pode regenerar sua chave a qualquer momento para revogar o acesso.
Defina a URL base para nosso endpoint dedicado. Isso garante que todas as solicitações sejam enviadas para nossa infraestrutura de modelo sem censura, em vez da nuvem padrão do OpenAI. Você pode encontrar sua chave de API na página 'Obter chave de API' imediatamente após o cadastro.
Envie sua primeira solicitação
Envie uma solicitação padrão de conclusão de chat para testar a conectividade. O ID do modelo é sempre uncensored. Este modelo é ajustado para responder sem recusas de conteúdo para uso adulto lícito, sendo ideal para escrita criativa, roleplay ou pesquisa sem restrições.
- Use
POST /v1/chat/completionspara geração de texto. - A janela de contexto suporta até 100.000 tokens para prompt mais conclusão.
- As solicitações são cobradas com base na contagem de tokens de entrada e saída.
curl https://api.hermesllmapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Ative o Streaming (SSE)
Para uma melhor experiência do usuário, ative o streaming para receber tokens conforme são gerados. Isso reduz a latência percebida, especialmente para respostas longas. O servidor retorna Eventos Enviados pelo Servidor (SSE) que seu cliente pode analisar em tempo real.
Defina o parâmetro stream como true no corpo da sua requisição. O SDK retornará blocos conforme chegam. Isso é especialmente útil para interfaces de chat onde você deseja exibir texto de forma incremental, em vez de aguardar o fim da resposta completa.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Use chamada de funções
Nossa API suporta chamada de funções, permitindo que o modelo gere JSON estruturado para execução de ferramentas externas. Defina suas funções no parâmetro tools, e o modelo retornará tool_calls na resposta se for apropriado.
Este recurso funciona exatamente conforme documentado na especificação do OpenAI. Você pode analisar o nome da função e os argumentos, executar a lógica do seu backend e alimentar os resultados de volta na conversa. É totalmente compatível com fluxos de trabalho padrão de chamada de funções do SDK do OpenAI.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hermesllmapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Verifique os modelos disponíveis
Consulte o endpoint de modelos para verificar a conectividade e ver as opções disponíveis. Atualmente, oferecemos um único modelo dedicado: uncensored. Essa simplicidade evita a complexidade de roteamento de modelos ou infraestrutura genérica, garantindo comportamento previsível.
Você também pode usar este endpoint para depurar problemas de autenticação. Se a solicitação falhar, verifique a validade da sua chave de API e a conectividade de rede. A resposta listará os detalhes do modelo, incluindo o tamanho da janela de contexto e os limites de tokens.
from openai import OpenAI
client = OpenAI(base_url="https://api.hermesllmapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Gerencie limites de requisições e erros
Nossa API impõe um limite de 300 solicitações por minuto por chave. Se você exceder isso, receberá um erro 429. Também suportamos um limite de corpo de solicitação de 8 MB para prompts complexos ou janelas de contexto grandes.
Erros comuns incluem 401 (chave inválida) e 402 (crédito insuficiente). O crédito pré-pago nunca expira, então você pode recarregar quando quiser. Bônus de crédito são aplicados automaticamente para compras maiores: +5% a partir de $50 e +10% a partir de $100.
Especificações técnicas
Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| ID do modelo | uncensored |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Autenticação | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.hermesllmapi.com/v1 |
| Saída máxima | até o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado) |
| Modo JSON | response_format: {"type": "json_object"} |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Janela de contexto | 100.000 tokens (entrada + saída) |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Limite de taxa | 300 requisições por minuto por chave |
| Tamanho | até 8 MB por requisição |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Validade | crédito pago não expira, sem assinatura |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
| Login | Google ou e-mail e senha |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
Códigos de erro
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |
Perguntas e respostas
A API Hermes suporta geração de imagens ou áudio?
Não, oferecemos atualmente uma API de conclusões de chat apenas para texto. Não suportamos embeddings, geração de imagens, áudio ou vídeo, nem oferecemos ajuste fino. Nosso foco é fornecer um modelo de texto sem censura direto para clientes compatíveis com OpenAI.
Como o modelo sem censura lida com conteúdo adulto?
O modelo não recusa tópicos adultos lícitos, fictícios ou controversos. No entanto, há um limite rígido de conteúdo: solicitações envolvendo conteúdo sexual com menores são sempre bloqueadas. Esta é a única restrição estrita aplicada aos seus prompts.
O que acontece se eu ficar sem crédito?
Sua chave de API permanece ativa, mas as solicitações retornarão um erro 402 indicando fundos insuficientes. Você pode recarregar sua conta com criptomoedas (USDT ou USDC) a qualquer momento. Seu crédito pré-pago nunca expira, então você pode adicionar fundos quando estiver pronto para continuar.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.