Modelos de vanguardia en GPUs propias: GLM-5.1, Kimi K2.6, MiniMax-M2.7, Qwen3-235B, desplegados globalmente. Latencia inferior a 100 ms, compatible con OpenAI, sin necesidad de gestionar infraestructura.
Los modelos hospedados se eligen deliberadamente, no para llenar un menú. Kimi K2.6 para voice AI en tiempo real, GLM-5.1 para desarrollo, MiniMax-M3 para costo, Qwen3-235B para cargas de trabajo equilibradas.
Ejecuta inferencia donde están tus usuarios, con GPUs dedicadas en las Américas, Europa y APAC. El cómputo en región entrega experiencias de baja latencia globalmente, y significa que los datos permanecen donde están tus usuarios, sin problemas de compliance.

Ejecuta modelos de última generación en el edge cerca de tus usuarios. Entrega consistentemente tiempos de respuesta sub-100ms en las Américas, UE y APAC.

Endpoints compatibles con OpenAI funcionan con SDKs existentes, para que puedas cambiar modelos fácilmente sin reescribir código.

Pasa de 0 a miles de requests por segundo sin planificar capacidad disponible. Paga solo por lo que usas.
Endpoints compatibles con OpenAI que funcionan con tu SDK existente y se despliegan globalmente.
Despliegue en región
La inferencia se ejecuta en las Américas, Europa y APAC, con MENA y LATAM próximamente. Tus datos permanecen donde están tus usuarios, y permanecen privados.
API compatible con OpenAI
Usa tu SDK de OpenAI existente cambiando la URL base para acceder a cómputo regional y modelos frontier.
Llamada de funciones
Conecta LLMs a herramientas y APIs externas para construir agentes que toman acción, no solo generan texto.
Escalado automático
GPUs dedicadas manejan requests concurrentes y escalan automáticamente con tu carga de trabajo, sin planificación de capacidad ni cold starts.
Fine-tuning
Personaliza modelos con tus propios datos vía la API de Fine-Tuning usando la misma infraestructura y API key.
Salida estructurada
Modo JSON y restricciones regex aseguran que la salida de inferencia se ajuste a tu esquema para resultados de grado de producción.
OpenAI-compatible. Change your base URL, that's it.
curl -i -X POST "https://api.telnyx.com/v2/ai/chat/completions" \
-H "Authorization: Bearer $TELNYX_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2-5",
"messages": [{"role": "user", "content": "Hello, World!"}]
}'Desde $0.21 por 1M de tokens. Sin tarifas de alquiler de GPU, sin recargos de cómputo, sin mínimos.
$0.21
Costo inicial por 1M de tokens
Tu IA no tiene que detenerse en texto. Telnyx ejecuta text-to-speech, voice AI y telefonía sobre la misma infraestructura. Misma API key, misma red, misma factura.

Descubre almacenamiento de baja latencia y rentable para tus aplicaciones de IA. Almacena datos y embeddings en un solo lugar.
Más información
Crea e implementa agentes de Voice AI de baja latencia en minutos en una plataforma conversacional full-stack. Controla voces, idiomas y flujos de llamada.
Más información
Una API para los principales motores de voz. Accede a ElevenLabs, Rime, MiniMax, Resemble AI y otros sin dependencia de un proveedor.
Más información
Elige entre una amplia variedad de LLM propietarios y open source de última generación, y mantente a la vanguardia de la IA.
Más informaciónTest frontier models running on edge compute. Telnyx gives you the infrastructure and support to deploy inference workloads globally from one platform.

Test frontier models running on edge compute. Telnyx gives you the infrastructure and support to deploy inference workloads globally from one platform.

Inference APIs let you send prompts to a deployed model and get predictions back over HTTP, without managing GPU hardware yourself. They wrap model serving behind a standard chat completions interface so any application can generate text, embeddings, or function calls on demand.