API de transcripción y subtitulado profesional de video en servidores de la UE — Inwista API v1
Hoy abrimos la maquinaria que hay detrás de Inwista: la API v1 ya está disponible. Todo lo que nuestro estudio hace con una grabación — voz a texto en más de 70 idiomas con identificación automática de hablantes, subtítulos formateados según estándares de emisión, traducción de subtítulos sobre el mismo archivo — está ahora disponible como piezas para construir tus propios sistemas.
Es una API de transcripción pequeña pero completa: ocho endpoints repartidos en cuatro recursos. Creas una transcripción a partir de una URL de medios — un archivo en tu propio almacenamiento, o simplemente un enlace de YouTube, TikTok o Vimeo — y después obtienes los subtítulos en cuatro formatos (archivos SRT y VTT, texto plano, o JSON estructurado con marcas de tiempo y hablantes), ejecutas una mejora de subtítulos configurable con calidad de emisión, y traduces esos mismos subtítulos a cualquiera de los más de 70 idiomas. Los webhooks avisan a tus sistemas cuando los trabajos terminan, y cada mejora y traducción es una revisión fijada que siempre se puede recuperar.
La facturación no podría ser más sencilla: la API consume los mismos créditos de IA que todo lo demás en Inwista. Sin contrato de API aparte, sin un nuevo contador que aprender — 4 créditos por cada minuto iniciado de medios, descontados primero de los créditos mensuales de tu plan y después de los packs de créditos de un solo pago, con reembolso automático cuando un trabajo falla. Todo se procesa con residencia de datos íntegramente en la UE, en nuestros propios servidores dentro de la UE/EEE — nunca se comparte, nunca se usa para entrenar modelos de IA.
curl -X POST https://api.inwista.ai/v1/transcriptions \
-H "Authorization: Bearer inw_live_…" \
-d '{ "source_url": "https://cdn.example.com/episode-04.mp4", "language": "en", "diarization": true }'
Coloca estas piezas en medio de un flujo de trabajo real y eliminan pasos que hoy equipos enteros hacen a mano. Así es la transcripción y el subtitulado automáticos en cinco mundos distintos.
Subtitulado broadcast automatizado para productoras
Una casa de posproducción que entrega una serie de diez episodios cierra hoy cada proyecto de la misma manera: las exportaciones van a un proveedor de subtitulado, los archivos vuelven días después, alguien hace comprobaciones al azar, una revisión va de vuelta, y la fecha de entrega se lo traga todo.
Con la API en el pipeline, el render que llega al almacenamiento dispara una transcripción, la mejora de subtítulos aplica vuestro estilo propio, y el archivo SRT terminado vuelve a través de una URL de webhook firmada, directo al MAM. Un episodio de 45 minutos son 180 créditos — y está subtitulado antes de que la sala de edición haya pasado al siguiente.
Y «estilo propio» no es una metáfora — el endpoint `/enhance` acepta las mismas reglas que un libro de estilo de subtitulado broadcast, como ajustes explícitos:
- Geometría de línea: `maxCharactersPerLine` (por defecto `42` — la convención broadcast) y `maxLinesPerBlock` (1 o 2)
- Equilibrado de líneas: `blockLineBalancing` — `bottom_heavy`, `top_heavy`, `equal` o `unconstrained`
- Timing: `minBlockDuration` y `maxBlockDuration` en segundos, para que ningún subtítulo pase como un rayo ni se quede colgado
- Densidad: `textCondensation` — `none`, `smart` o `aggressive` — cuando el texto literal no cabe en la ventana de lectura
- Diálogo: `speakerDialogueFormat` — guiones, etiquetas entre corchetes o nombres completos de los hablantes
- Continuidad: `continuationMarkers` al inicio/final de los bloques, como guion o puntos suspensivos
- Destino de entrega: `gapBetweenBlocks` con preajustes para `broadcasting`, `streaming` o `sdh`
curl -X POST https://api.inwista.ai/v1/transcriptions/{id}/enhance \
-H "Authorization: Bearer inw_live_…" \
-d '{ "settings": { "maxCharactersPerLine": 37, "blockLineBalancing": "bottom_heavy", "textCondensation": "smart" } }'
La misma transcripción, adaptada a cada destino de entrega — subtítulos para emisión, otra pasada para streaming, una versión SDH para accesibilidad — y cada una es una revisión fijada: cuando una cadena pregunta qué versión de subtítulos se entregó en marzo, ese archivo exacto se puede reproducir por ID. El control de calidad del subtitulado deja de ser una discusión sobre adjuntos de correo.
Subtitula clases universitarias a gran escala — WCAG y la Ley Europea de Accesibilidad
La Ley Europea de Accesibilidad (EAA) convirtió los subtítulos en video de una cortesía en un requisito legal, y la mayoría de las instituciones están sentadas sobre el mismo problema: una década de clases grabadas y un presupuesto de subtitulado que se lee como una obra. Facturado a la manera tradicional, por minuto de trabajo humano, un archivo de 800 clases se convierte en una reunión de presupuesto — así que sigue sin subtitular.
A través de la API, ese mismo catálogo es un bucle: recupera cada grabación del almacenamiento, transcribe, obtén el archivo VTT, adjúntalo en el LMS. A 4 créditos por minuto, se ejecuta en una noche en lugar de en un semestre, y el atraso de accesibilidad se convierte en subtítulos conformes con las WCAG en cada clase. Los cursos estrella van una llamada más allá: `/translate` convierte los mismos archivos de subtítulos en subtítulos multilingües en los idiomas que tus estudiantes hablan de verdad, con el timing heredado del original.
Transcribe videos de YouTube y archivos de pódcast con una sola llamada
Los equipos de medios rara vez tienen archivos fuente ordenados de su catálogo antiguo. Lo que tienen son enlaces. La API acepta URL de YouTube y Vimeo directamente, con lo que «hacer el archivo buscable» pasa de ser un proyecto de migración a un script de una tarde: recorre el canal, transcribe cada episodio con nombres de hablantes, publica la transcripción bajo la página de cada episodio.
Lo que eso compra, en concreto: un archivo de 400 entrevistas se vuelve buscable a texto completo para la redacción, citable para clips de redes sociales, indexable para los buscadores — y accesible, algo que plataformas y solicitudes de subvención preguntan cada vez más. Sin volver a subir nada, sin factura de almacenamiento, sin ningún becario con auriculares.
Una API de voz a texto conforme con el RGPD para equipos de producto
Muchos productos quieren un botón de «Generar subtítulos» — plataformas de video, herramientas de entrevistas, proveedores de LMS, legal tech, software de RR. HH. Rara vez es la ingeniería lo que lo frena; es la evaluación del proveedor. En algún punto entre «envía las grabaciones de los clientes a una nube estadounidense» y «puede usar el contenido para entrenar modelos», el departamento legal dice que no.
La API de Inwista es la versión de esa conversación que termina rápido: una API de transcripción conforme con el RGPD donde el procesamiento ocurre exclusivamente en nuestros propios servidores de la UE/EEE, el contenido nunca se comparte con terceros y nunca se usa para entrenamiento — frases que puedes escribir tal cual en tu propia política de privacidad. La parte técnica también está construida para producción: claves de idempotencia en cada operación de escritura, límites de velocidad predecibles, facturación atómica con reembolsos automáticos, y un campo `metadata` que lleva tus propios ID de referencia por todo el flujo, para que los webhooks lleguen a tu sistema ya etiquetados.
Subtítulos SDH para plenos y actos públicos, la misma tarde
Ayuntamientos y administraciones públicas emiten horas de sesiones cada semana, y la expectativa de accesibilidad solo se mueve en una dirección. Un pleno municipal de tres horas subtitulado a mano es una factura de verdad; a través de la API son 720 créditos y está listo la misma tarde — transcrito con nombres de hablantes, formateado con el preajuste SDH, publicado junto a la grabación. Donde los vecinos hablan más de un idioma, los mismos subtítulos se traducen con una llamada más.
Para contratación pública, las preguntas que normalmente requieren una reunión entera se responden en una línea: procesamiento en la UE/EEE, RGPD, sin entrenamiento con el contenido, borrado bajo tu control.
Todos los planes incluyen créditos de API — también el gratuito
Como la API consume tus créditos de IA normales, no hay que comprar nada extra para probarla. El plan gratuito incluye 100 créditos cada mes — suficiente para unos 25 minutos de transcripción por API, renovados mensualmente, para que puedas construir tu integración y mantener un pequeño flujo de trabajo funcionando sin pagar nada. (Los 45 minutos de estudio del plan gratuito son aparte: úsalos para revisar transcripciones y estilos de subtítulos con tus propios ojos en la aplicación antes de escribir una sola línea de código.)
Los planes de pago incluyen entre 1000 y 2500 créditos al mes, y los packs de créditos de un solo pago — que nunca caducan — cubren todo lo demás. Los trabajos fallidos se reembolsan solos automáticamente, de vuelta allí de donde salieron los créditos.
La referencia completa — autenticación, webhooks, formatos, gestión de errores — está en nuestra Referencia de la API. Si estás construyendo algo más grande, o necesitas precios por volumen para un archivo de verdad: sales@inwista.ai.
Preguntas frecuentes
¿Qué puede aceptar esta API de transcripción?
URL de medios públicas — archivos de audio o video, o enlaces de YouTube, TikTok y Vimeo directamente. Más de 70 idiomas, con identificación automática de hablantes (diarización).
¿Qué devuelve?
SRT, VTT, TXT o JSON estructurado — además de versiones con formato broadcast y traducidas de los mismos subtítulos bajo petición.
¿Puedo controlar el formato de los subtítulos?
Sí — caracteres por línea, líneas por bloque, equilibrado de líneas, límites de tiempo, condensación de texto, marcado de diálogo, marcadores de continuidad y preajustes para emisión, streaming o SDH son todos ajustes explícitos del endpoint de mejora.
¿Puedo probar la API gratis?
Sí. La API descuenta de los mismos créditos de IA que el resto de Inwista, y todos los planes incluyen una asignación mensual — 100 créditos en el plan gratuito, unos 25 minutos de transcripción cada mes.
¿Es la API conforme con el RGPD?
Sí — todo el procesamiento se ejecuta en los propios servidores de Inwista dentro de la UE/EEE. El contenido nunca se comparte con terceros y nunca se usa para entrenar modelos de IA.
¿Cuánto cuesta?
4 créditos por cada minuto iniciado, descontados primero de los créditos de IA mensuales de tu plan y después de los packs de un solo pago — que nunca caducan. Los trabajos fallidos se reembolsan automáticamente.
¿Qué velocidad tiene?
Unos diez minutos de procesamiento por cada hora de audio.