Sur des GPU Telnyx à Paris.

Inférence IA en France.

Des modèles open source de pointe exécutés à Paris. GLM-5.2, Kimi K2.6, MiniMax-M3 et Qwen3-235B, avec une latence inférieure à 200 ms et une compatibilité OpenAI. Vos données sont traitées en France, pas seulement stockées.

CiscoOpenAITalkdeskAmerican Red CrossZillowMicrosoftCosmoIBMState of IowaCiscoOpenAITalkdeskAmerican Red CrossZillowMicrosoftCosmoIBMState of Iowa
ENVIRONNEMENT D'EXÉCUTION D'AGENT

Des modèles de pointe

Nos modèles hébergés sont sélectionnés délibérément, pas pour remplir un menu déroulant. GLM-5.2 pour le développement, MiniMax-M3 pour l'optimisation des coûts, Kimi K2.6 pour la voix IA en temps réel, Qwen3-235B pour des charges de travail équilibrées. Tous exécutés à Paris.

Loading...
POURQUOI TELNYX

Conçue pour la réglementation européenne

Une infrastructure pensée pour le RGPD et la loi européenne sur l'IA. L'inférence s'exécute en région : vos données restent en France, du stockage au traitement, sans transfert transfrontalier ni zone d'ombre réglementaire. La conformité est intégrée à l'architecture, pas promise dans un contrat.

FONCTIONNALITÉS

Une inférence prête pour la production, conçue pour l'Europe

Traité à Paris, pas simplement stocké. L'inférence s'exécute sur une infrastructure physiquement située à Paris, avec une compatibilité OpenAI et aucune réécriture de code.

  • Traité à Paris, pas seulement stocké

    L'inférence s'exécute sur une infrastructure physiquement située à Paris. Vos données restent en France, du stockage au traitement, sans aucun saut transfrontalier.

  • API compatible OpenAI

    Utilisez votre SDK OpenAI existant en changeant simplement l'URL de base. Accédez au calcul parisien et aux modèles open source de pointe en modifiant un seul endpoint.

  • Function calling

    Connectez les LLM à des outils et API externes pour créer des agents qui agissent, et pas seulement génèrent du texte.

  • Autoscaling

    Une capacité dédiée gère les requêtes concurrentes et évolue avec votre charge de travail. Aucune planification de capacité, aucun démarrage à froid.

  • Fine-tuning

    Personnalisez les modèles avec vos propres données via l'API de fine-tuning, sur la même infrastructure en région et avec la même clé API.

  • Sortie structurée

    Le mode JSON et les contraintes regex garantissent que la sortie de l'inférence respecte votre schéma, pour une fiabilité de niveau production.

COMMENT ÇA MARCHE

Migrez en quelques minutes

Compatible OpenAI. Changez votre URL de base, c'est tout.

curl -i -X POST "https://api.telnyx.com/v2/ai/chat/completions" \
     -H "Authorization: Bearer $TELNYX_API_KEY" \
     -H "Content-Type: application/json" \
     -d '{
       "model": "kimi-k2-5",
       "messages": [{"role": "user", "content": "Hello, World!"}]
     }'
PRICING

Tarification transparente, sans cloud tax

À partir de 0,51 $ par million de tokens d'entrée. Pas de frais de location GPU, pas de suppléments de calcul, pas de minimums.

0,51 $

Coût de départ par million de tokens d'entrée

PRODUITS

Construire une IA qui va au-delà du chat ?

Votre IA n'a pas à s'arrêter au texte. Telnyx exécute la synthèse vocale, la Voice AI et la téléphonie sur la même infrastructure. Même clé API, même réseau, même facture.

Inscrivez-vous et commencez à construire.

Testez des modèles de pointe exécutés à Paris. Telnyx vous donne l'infrastructure et le support pour déployer l'inférence à travers l'Europe depuis une seule plateforme, avec vos données traitées en région.

Sign up for Telnyx Inference

FAQ

Les API d'inférence vous permettent d'envoyer des prompts à un modèle déployé et de recevoir des prédictions via HTTP, sans gérer vous-même le matériel GPU. Elles encapsulent le service de modèles derrière une interface standard de complétion de chat afin que toute application puisse générer du texte, des embeddings ou des appels de fonctions à la demande.