API Hermes : Changez de client en trois lignes
Commencez avec l'API Hermes en quelques minutes en utilisant les SDK OpenAI standards. Ce guide de démarrage rapide couvre la configuration, les requêtes de base, le streaming et la gestion des erreurs pour votre intégration de LLM sans censure.
- par 1M de tokens d'entrée
- $0.25
- Tokens de sortie / 1M
- $1.00
- fenêtre de contexte de tokens
- 100,000
- crédit d'essai gratuit
- $0.50
- requêtes par minute
- 300
Installer le SDK OpenAI
Puisque notre endpoint est compatible OpenAI, vous pouvez utiliser les SDK officiels que vous connaissez déjà. Cette approche vous permet de passer d'autres fournisseurs sans réécrire la logique de votre application. Nous prenons en charge le package openai pour les environnements Python et Node.js.
Assurez-vous d'utiliser une version récente du SDK pour garantir la compatibilité avec le streaming et l'appel de fonctions. La bibliothèque client gère automatiquement la sérialisation JSON et le transport HTTP, afin que vous puissiez vous concentrer sur les paramètres du modèle plutôt que sur les détails réseau.
Configurer l'URL de base et la clé
L'authentification est gérée via un token Bearer dans l'en-tête Authorization. Vous obtenez votre clé en vous inscrivant avec un e-mail et un mot de passe sur notre tableau de bord. Aucune carte bancaire n'est requise pour l'essai, et vous pouvez régénérer votre clé à tout moment pour révoquer l'accès.
Définissez l'URL de base sur notre endpoint dédié. Cela garantit que toutes les requêtes vont vers notre infrastructure de modèle sans censure au lieu du cloud OpenAI par défaut. Vous pouvez trouver votre clé API sur la page 'Obtenir une clé API' immédiatement après l'inscription.
Envoyer votre première requête
Envoyez une requête de complétion de chat standard pour tester la connectivité. L'ID du modèle est toujours uncensored. Ce modèle est optimisé pour répondre sans refus de contenu pour une utilisation adulte légale, ce qui le rend idéal pour l'écriture créative, le jeu de rôle ou la recherche sans restriction.
- Utilisez
POST /v1/chat/completionspour la génération de texte. - La fenêtre de contexte prend en charge jusqu'à 100 000 tokens pour le prompt et la complétion.
- Les requêtes sont facturées en fonction du nombre de tokens d'entrée et de sortie.
curl https://api.hermesllmapi.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Activer le streaming (SSE)
Pour une meilleure expérience utilisateur, activez le streaming pour recevoir les tokens au fur et à mesure de leur génération. Cela réduit la latence perçue, en particulier pour les réponses plus longues. Le serveur renvoie des Server-Sent Events (SSE) que votre client peut analyser en temps réel.
Définissez le paramètre stream sur true dans le corps de votre requête. Le SDK génèrera des chunks à mesure qu'ils arrivent. Cela est particulièrement utile pour les interfaces de chat où vous souhaitez afficher le texte de manière incrémentielle plutôt que d'attendre la fin de toute la réponse.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Utiliser l'appel de fonctions
Notre API prend en charge l'appel de fonctions, permettant au modèle de générer du JSON structuré pour l'exécution d'outils externes. Définissez vos fonctions dans le paramètre tools, et le modèle renverra tool_calls dans la réponse si cela est approprié.
Cette fonctionnalité fonctionne exactement comme documenté dans la spécification OpenAI. Vous pouvez analyser le nom de la fonction et les arguments, exécuter la logique de votre backend et renvoyer les résultats dans la conversation. Elle est entièrement compatible avec les workflows d'appel de fonctions des SDK OpenAI standards.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.hermesllmapi.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Vérifier les modèles disponibles
Interrogez l'endpoint des modèles pour vérifier la connectivité et voir les options disponibles. Actuellement, nous proposons un seul modèle dédié : uncensored. Cette simplicité évite la complexité du routage des modèles ou de l'infrastructure générique, garantissant un comportement prévisible.
Vous pouvez également utiliser cet endpoint pour déboguer les problèmes d'authentification. Si la requête échoue, vérifiez la validité de votre clé API et la connectivité réseau. La réponse listera les détails du modèle, y compris la taille de la fenêtre de contexte et les limites de tokens.
from openai import OpenAI
client = OpenAI(base_url="https://api.hermesllmapi.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Gérer les limites de débit et les erreurs
Notre API applique une limite de 300 requêtes par minute par clé. Si vous dépassez ce seuil, vous recevrez une erreur 429. Nous supportons également une limite de corps de requête de 8 Mo pour les prompts complexes ou les grandes fenêtres de contexte.
Les erreurs courantes incluent 401 (clé invalide) et 402 (crédit insuffisant). Le crédit prépayé n'expire jamais, vous pouvez donc recharger à votre convenance. Des bonus de crédit sont appliqués automatiquement pour les achats plus importants : +5 % à partir de 50 $ et +10 % à partir de 100 $.
Caractéristiques techniques
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| ID du modèle | uncensored |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Authentification | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.hermesllmapi.com/v1 |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Mode JSON | response_format: {"type": "json_object"} |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Concurrence | 8 requêtes simultanées par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Limite de débit | 300 requêtes par minute et par clé |
| Taille | jusqu'à 8 Mo par requête |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Connexion | Google ou e-mail et mot de passe |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
Codes d'erreur
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
L'API Hermes prend-elle en charge la génération d'images ou d'audio ?
Non, nous proposons actuellement une API de chat-completions textuelle uniquement. Nous ne prenons pas en charge les embeddings, la génération d'images, d'audio ou de vidéo, ni l'ajustement fin. Notre objectif est de fournir un modèle textuel sans censure simple et adapté aux clients compatibles OpenAI standards.
Comment le modèle sans censure gère-t-il le contenu pour adultes ?
Le modèle ne refuse pas les sujets légaux pour adultes, fictifs ou controversés. Cependant, il existe une limite stricte de contenu : les requêtes impliquant du contenu sexuel avec des mineurs sont toujours bloquées. Il s'agit de la seule restriction stricte appliquée à vos prompts.
Que se passe-t-il si je manque de crédit ?
Votre clé API reste active, mais les requêtes renverront une erreur 402 indiquant des fonds insuffisants. Vous pouvez recharger votre compte avec des cryptomonnaies (USDT ou USDC) à tout moment. Votre crédit prépayé n'expire jamais, vous pouvez donc ajouter des fonds quand vous êtes prêt à continuer.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.