Compatible API OpenAI · Inférence en France

api.llms.fr
un endpoint, tous vos outils

api.llms.fr expose les meilleurs modèles hébergés en France via une API compatible OpenAI. Changez une URL de base, et vos applications, workflows et agents de code - OpenCode, OpenClaw, Hermes Agent, Claude Code - tournent sur une IA conforme RGPD.

migration en 30 secondes
# Avant : vos données quittent l'Union européenne
export OPENAI_BASE_URL="https://api.openai.com/v1"

# Après : vos données restent en France
export OPENAI_BASE_URL="https://api.llms.fr/v1"
export OPENAI_API_KEY="llms_sk_..."

Opérationnel en 3 étapes

1

Obtenez votre clé

Demandez un accès via notre formulaire. Vous recevez une clé API et la documentation sous 48 h.

2

Changez l'URL de base

Pointez votre SDK, outil ou agent vers https://api.llms.fr/v1. Aucune autre modification de code.

3

Choisissez votre modèle

Mistral, Llama, Qwen, DeepSeek… ou votre instance GPU dédiée. Changez de modèle en changeant un paramètre.

Branchez vos outils et vos agents

SDK, frameworks, plateformes no-code et agents de code : si l'outil parle le format OpenAI, il parle à api.llms.fr.

curl https://api.llms.fr/v1/chat/completions \
  -H "Authorization: Bearer $LLMS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-small-3",
    "messages": [{"role": "user", "content": "Bonjour !"}]
  }'

Fonctionne aussi avec LangChain, LlamaIndex, n8n, Flowise, Dify, LibreChat, Open WebUI, Aider, Continue, Cline et tout client compatible OpenAI.

Ce que fait l'API

Compatible API OpenAI

Endpoints /v1/chat/completions, /v1/embeddings, /v1/models. Streaming, function calling, sorties structurées JSON. Vos SDK et outils actuels fonctionnent sans modification.

Multi-modèles & fallback

Un seul endpoint pour tout le catalogue : changez de modèle en changeant un paramètre. Règles de routage et repli automatique si un modèle est indisponible.

Clés & quotas par équipe

Créez des clés API par projet, par équipe ou par agent, avec quotas et plafonds de dépense. Révocation instantanée.

Observabilité sans indiscrétion

Volumes, latences, coûts par clé et par modèle - sans journaliser le contenu de vos prompts. La journalisation des contenus est strictement opt-in.

Inférence en France

Toutes les requêtes sont servies par des GPU situés en France. Aucun transfert hors UE, aucune exposition au Cloud Act.

Zéro rétention par défaut

Vos prompts et réponses ne sont ni stockés ni utilisés pour entraîner des modèles. Conforme RGPD, DPA fourni.

Questions fréquentes

Prêt à rapatrier votre IA en France ?

Obtenez une clé de test, branchez vos outils, et mesurez par vous-même : même API, mêmes performances, zéro donnée hors UE.

Demander un accès →