Starter
Modèles jusqu'à 14B - chatbot interne, RAG documentaire, extraction
Les meilleurs modèles open-weight - Mistral, Llama, Qwen, DeepSeek - servis depuis des GPU hébergés en France. Vos données ne quittent jamais l'Union européenne, ne servent jamais à entraîner de modèles, et vos outils existants fonctionnent sans réécriture grâce à notre API compatible OpenAI.
Réponse sous 48 h · DPA art. 28 RGPD · Sans engagement pour l'API
Utiliser une IA cloud grand public en entreprise, c'est souvent envoyer vos documents, votre code et les données de vos clients sur des serveurs situés hors de l'Union européenne, soumis à des législations extraterritoriales. Il existe une autre voie.
Inférence exécutée sur des GPU situés dans des datacenters français, opérés par des acteurs européens. Aucun transfert de données hors UE, aucune exposition au Cloud Act.
Pas de conservation des prompts par défaut, pas d'entraînement sur vos données, DPA conforme à l'article 28. Votre DPO valide en une lecture, pas en six mois d'analyse de transferts internationaux.
L'endpoint api.llms.fr est une API compatible OpenAI : changez une URL et une clé, et vos applications, agents et intégrations existants fonctionnent immédiatement.
Modèles open-weight : pas de dépendance à un fournisseur unique, pas de changement de comportement du modèle du jour au lendemain, réversibilité totale - vous pouvez même rapatrier le modèle en local.
Démarrez en quelques minutes : un catalogue de modèles open-weight de référence, servis depuis la France, facturés au million de tokens. Idéal pour prototyper puis passer à l'échelle.
| Modèle | Taille | Points forts | Contexte | Entrée / 1M tokens | Sortie / 1M tokens |
|---|---|---|---|---|---|
| Qwen3-Coder 30B | 30B MoE | Code & agents de développement, très rapide | 256K | 0,15 € | 0,50 € |
| Mistral Small 3.2 | 24B | Chat, extraction, résumé - excellent en français | 128K | 0,20 € | 0,60 € |
| gpt-oss-120b | 120B MoE | Raisonnement, agents, usage général | 128K | 0,30 € | 1,20 € |
| Llama 3.3 70B | 70B | Usage général, forte qualité multilingue | 128K | 0,90 € | 0,90 € |
| GLM-5.2 | MoE (~750B) | Code long-horizon et agentique, état de l'art open-weight | 200K | 1,00 € | 3,90 € |
| DeepSeek V4 | MoE | Raisonnement complexe, maths, analyse | 128K | 0,90 € | 3,60 € |
Tarifs de lancement, HT. Le catalogue évolue avec les meilleures sorties open-weight, et nous ajoutons un modèle à la demande sous 24-48 h. Streaming, function calling et sorties structurées inclus sur tous les modèles. Voir la grille complète et les packs de crédits →
Une instance GPU réservée à votre entreprise, dimensionnée avec vous selon vos volumes, vos modèles et vos contraintes. Isolation totale, coût mensuel prévisible, modèles au choix - y compris vos modèles fine-tunés.
Modèles jusqu'à 14B - chatbot interne, RAG documentaire, extraction
Modèles jusqu'à 70B quantisés - assistants métier, agents, code
70B+ pleine précision, fort débit - production exigeante, multi-équipes
Très grands modèles, fine-tuning, SLA renforcé, volumes importants
Dès que vos prompts contiennent des données personnelles, médicales, financières ou du code propriétaire, la localisation du traitement n'est plus un détail : c'est une obligation.
Aide au compte-rendu, synthèse de dossiers, courriers - sans exporter de données patients hors UE.
Analyse de contrats et de pièces couvertes par le secret professionnel, en toute confidentialité.
Traitement de documents clients et conformité DORA/ACPR, avec un sous-traitant européen.
Une IA générative alignée avec les doctrines cloud de l'État et l'exigence de souveraineté.
Agents de code (OpenCode, OpenClaw, Aider…) branchés sur vos modèles : votre code source ne quitte pas l'Europe.
Assistants internes sur documents RH, paie, entretiens - des données par nature ultra-sensibles.
Vos requêtes sont traitées sur des serveurs GPU situés en France, opérés par des acteurs européens. Aucune donnée ne transite hors de l'Union européenne, et l'infrastructure n'est pas soumise à des législations extraterritoriales hors UE (comme le Cloud Act ou FISA). C'est la différence fondamentale avec la plupart des API cloud, dont les données transitent par des entités situées hors de l'Union européenne.
Non, jamais. Vos prompts et les réponses générées ne sont ni conservés par défaut, ni utilisés pour entraîner ou améliorer des modèles. La journalisation des contenus est désactivée par défaut et ne peut être activée que par vous, par exemple à des fins de débogage.
Oui. LLMs.fr Cloud est exposé via api.llms.fr, dont l'API est compatible avec l'API OpenAI (endpoints /v1/chat/completions, /v1/embeddings, streaming, function calling). Dans la plupart des outils, il suffit de changer la variable base URL et la clé API - aucune réécriture de code.
Oui, c'est l'un des usages phares de l'API. Tout agent capable de parler à une API compatible OpenAI (OpenCode, OpenClaw, Hermes Agent, Aider, Continue…) peut être pointé vers api.llms.fr. Vos agents de développement travaillent alors sur des modèles hébergés en France : le code de votre entreprise ne quitte plus l'Union européenne.
L'API mutualisée est facturée au million de tokens : idéale pour démarrer, pour des volumes variables ou des usages ponctuels. L'instance GPU dédiée vous réserve du matériel à prix fixe mensuel : isolation totale (aucun autre client sur le GPU), débit garanti, choix libre du modèle - y compris vos modèles fine-tunés - et coût prévisible dès que vos volumes deviennent importants.
Oui. Un DPA conforme à l'article 28 du RGPD est fourni avec chaque contrat, précisant les mesures de sécurité, la localisation des traitements, les sous-traitants et les conditions de réversibilité. De quoi passer sereinement les revues de votre DPO et de votre RSSI.
Écrivez-nous à hello@llms.fr en décrivant votre cas d'usage et vos volumes estimés. Nous vous répondons sous 48 h avec une recommandation de dimensionnement (API mutualisée ou GPU dédié) et un accès de test. La mise en service d'une instance dédiée prend quelques jours.
Décrivez-nous vos besoins - volumes, modèles, contraintes de conformité - et nous vous proposons un dimensionnement et un accès de test sous 48 h.
Demander un accès →