← Alle Playbooks
Playbook· lokal

Transcribir conversaciones sin conexión, sin que salgan de casa

Primera consulta con un cliente, anamnesis, entrevista de trabajo. Diez pasos hacia una transcripción que corre por completo en tu ordenador, incluidas las dos condiciones sin las cuales la promesa no se sostiene.

Hay un tipo de grabación que no subes. La primera consulta con una clienta, la anamnesis, la conversación con un empleado sobre un despido, la entrevista con una fuente que tiene que quedar en el anonimato. En exactamente esas grabaciones una transcripción sería lo más valioso, y en exactamente esas quedan descartadas las herramientas de reuniones habituales.

La parte buena de esta historia: el reconocimiento de voz es el terreno en el que ir en local supone renunciar a menos. Los modelos son pequeños, la tarea es estrecha, y la distancia con la nube es menor que en casi todo lo demás. Un ordenador demasiado flojo para modelos de texto transcribe igualmente de forma decente. Al final de este playbook tendrás un proceso en el que el archivo de audio no sale de tu ordenador, y sabrás dónde ese proceso llega a su límite.

Una frase por delante, porque de ella depende toda la promesa: que el modelo calcule en local no basta para eso. Hacen falta dos cosas más, la carpeta y el programa, y las dos están en el paso 10. Quien se las salta tiene una transcripción local en una carpeta que la nube sincroniza.

1. Aclara primero si tu caso tiene que ser realmente local

El esfuerzo no compensa para cualquier grabación. Si vas a levantar acta de una reunión interna sobre el color del logo nuevo, coge la herramienta que ya lleva dentro tu software de vídeo. El camino está en Notas de IA para reuniones, y para el caso normal es más rápido y más cómodo.

Lo local se vuelve interesante en cuanto se cumple una de estas tres condiciones. Hay categorías especiales de datos personales de por medio, por ejemplo salud, origen, convicción religiosa, afiliación sindical, vida sexual, datos biométricos o genéticos. O existe un secreto profesional, en médicas, abogados, terapeutas, asesores fiscales. O la otra parte consintió la grabación pero expresamente no su comunicación a un proveedor de servicios.

Consejo: Si no lo tienes claro, compruébalo con una pregunta. ¿Podrías decirle a la persona a la cara, durante la conversación, que esta grabación va a ir enseguida al servidor de un tercero? Si dudas, el caso pertenece aquí.

2. Entiende qué es Whisper y qué te permite la licencia

El estándar de hecho para el reconocimiento de voz local se llama Whisper y viene de OpenAI. Eso suena de entrada a contradicción, pero no lo es: Whisper está publicado como modelo abierto, el código y los pesos están bajo licencia MIT. Lo descargas una vez y a partir de ahí lo ejecutas por completo en tu ordenador. No se registra en ningún sitio ni pregunta nada.

MIT es la más sencilla de las licencias habituales. Puedes trabajar con ella comercialmente, integrarla en un producto y usarla de cara a tus clientes, sin que nadie te imponga condiciones sobre el número de usuarios. Sí hay una condición, y a menudo se pasa por alto: si distribuyes código o pesos, el aviso de copyright y el texto de la licencia tienen que ir con ellos. Eso vale para la distribución, no para el simple uso, y no exige ningún crédito visible en tu interfaz. Pero quien empaqueta Whisper en un producto y lo entrega adjunta el archivo de licencia.

Consejo: No lo confundas con la API de voz de OpenAI, que lleva el mismo nombre. Esa corre en servidores ajenos y es justo lo que quieres evitar aquí. Siempre se habla del modelo que te descargas tú.

3. Elige el tamaño del modelo según tu hardware

Whisper existe en seis tamaños. Los datos proceden de la descripción oficial de los modelos, a fecha de agosto de 2026, y la necesidad de memoria se refiere a memoria gráfica.

El escalón más pequeño se llama tiny, con 39 millones de parámetros y alrededor de un gigabyte de necesidad. base está en 74 millones y también en torno a un gigabyte. small tiene 244 millones y necesita unos dos gigabytes. medium llega a 769 millones y unos cinco gigabytes. large es, con 1,55 mil millones de parámetros y unos diez gigabytes, el escalón más pesado. En medio está turbo, con unos 800 millones de parámetros y alrededor de seis gigabytes.

Para material en alemán empieza por small y sube si la tasa de error te molesta. Los cuatro escalones más pequeños existen además en una variante solo inglés con el añadido .en, que es más precisa con sonido en inglés y no te sirve de nada con sonido en alemán.

Consejo: turbo es una versión de large-v3 optimizada para velocidad y en la mayoría de los casos el mejor compromiso. Un detalle que se pasa por alto con facilidad: turbo no está entrenado para traducir. Si quieres que el sonido en otro idioma se traduzca al inglés en vez de transcribirse en el idioma original, necesitas uno de los escalones multilingües.

4. Decídete por un entorno de ejecución

El mismo modelo lo pueden ejecutar programas distintos, y la diferencia es considerable. Hay tres caminos extendidos, los tres bajo MIT.

La versión original de OpenAI es un paquete de Python. Es el punto de referencia, pero la variante más lenta. whisper.cpp es una reimplementación en C y C++ sin dependencias, que maneja bien también el cálculo con solo procesador y en Apple Silicon usa la unidad gráfica a través de Metal. faster-whisper se apoya en la biblioteca de inferencia CTranslate2 y es, según el propio proyecto, hasta cuatro veces más rápida que el original con menos consumo de memoria.

Lo grande que es la diferencia lo enseña una medición del proyecto faster-whisper. La misma grabación de trece minutos, el mismo modelo small, un procesador Core i7-12700K con ocho hilos: la versión original necesita seis minutos y 58 segundos, whisper.cpp dos minutos y cinco segundos, faster-whisper con compresión de 8 bits un minuto y 42 segundos.

Lee esas cifras con atención, porque no comparan solo programas. La versión original calcula ahí con precisión completa, faster-whisper con compresión de 8 bits. Eso es parte de la ganancia de velocidad, y la biblioteca que hay detrás describe la pérdida de precisión por esa compresión como escasa o nula, no como descartada. Dos pasadas solo son comparables cuando el modelo, el tamaño de beam y los ajustes de decodificación son los mismos.

Consejo: Si no programas, coge una de las interfaces gráficas que llevan whisper.cpp dentro en vez de compilar tú. No buscas una experiencia de terminal, buscas una transcripción.

5. Haz la primera pasada con material real

El error más frecuente en este punto es una prueba con una grabación de muestra bien locutada. Esa siempre sale. Coge en su lugar una grabación real de tu día a día, con dialecto, términos técnicos, carraspeos y el compañero que se mete a hablar por encima.

Fija el idioma expresamente en alemán en vez de dejar que lo adivine. Whisper detecta el idioma automáticamente, y en los primeros segundos de una grabación con murmullo de saludos a veces se equivoca. Un inglés mal detectado se arrastra entonces por todo el archivo. En la versión original una pasada se ve así:

whisper grabacion.wav --model small --language German

Los demás entornos de ejecución del paso 4 se invocan de otra manera, pero la idea de fondo es la misma. Lo que tu versión sabe hacer además te lo enseña whisper --help.

Consejo: Whisper suele ser más fuerte en inglés que en alemán, y el vocabulario especializado no lo pone más fácil. Lo grande que es esa diferencia con tu material solo se ve con tu propio sonido. No esperes perfección en la primera pasada, valora más bien si la estructura es correcta y los nombres encajan aproximadamente.

6. Mide la velocidad con tu propio material

La única cifra que cuenta es la relación entre tiempo de cálculo y duración de la grabación. Si tu ordenador necesita veinte minutos para una hora de sonido, eso está perfectamente bien para procesar por lotes al terminar la jornada. Si necesita dos horas, después de la tercera vez ya no lo harás.

Mídelo con un archivo real y no con un fragmento de dos minutos, porque el coste de arranque distorsiona el valor en archivos cortos. Apunta el resultado junto con el tamaño de modelo y el entorno de ejecución.

Consejo: Si va demasiado lento, toca primero el entorno de ejecución y solo después el tamaño del modelo. Pasar de la versión original a faster-whisper mantiene la precisión más o menos con los mismos ajustes, mientras que bajar de small a tiny la cuesta con seguridad. Comprueba el cambio una vez con un archivo cuya transcripción ya conozcas.

7. Mejora el sonido antes de tocar el modelo

La mayor ganancia de calidad rara vez está en el modelo. Está en el micrófono. Un micrófono de solapa o unos auriculares con micro le ganan a cualquier escalón de modelo con el que pensabas compensarlo. Dos personas ante el micrófono de un portátil en una sala de reuniones con eco son difíciles para cualquier modelo, por grande que sea.

La segunda palanca son los términos técnicos y los nombres propios. La mayoría de los entornos permiten aportar un texto breve que ajusta el modelo al vocabulario. Escribe ahí los nombres de los participantes y tus diez palabras técnicas más frecuentes.

Consejo: Un modelo que adivina texto a partir de mal sonido se inventa frases plausibles. Eso es más peligroso que un hueco, porque al leerlo se siente correcto. En grabaciones importantes vale: escuchar contra el original en los puntos decisivos.

8. Convierte la transcripción en algo aprovechable

Una transcripción en bruto todavía no es una nota, es solo más texto. El segundo paso le corresponde a un modelo de lenguaje que convierte el acta literal en un resumen, una lista de tareas y las decisiones.

Si tomas este camino para conversaciones confidenciales, ese segundo paso también tiene que correr en local. Si no, habrás mantenido la grabación en casa y habrás subido después igualmente el contenido completo. Qué modelo de texto encaja con tu equipo lo aclara Qué modelo local encaja con tu hardware.

Consejo: Aquí está el límite más honesto de este proceso. Whisper no separa hablantes por sí mismo, entrega un texto corrido sin asignar quién dijo qué. Esa separación de hablantes es justo lo que hacen bien los servicios de nube especializados. Hay herramientas adicionales para ello, pero son un proyecto aparte y no cosa de una tarde.

9. Aclara la parte legal, no desaparece

Aquí se saca a menudo una conclusión equivocada. Que los datos no salgan de tu ordenador es una ventaja real y grande, porque desaparece la comunicación a un tercero y con ella todo un montón de preguntas sobre encargo del tratamiento y transferencias internacionales. Pero no hace que el tratamiento sea automáticamente lícito.

Sigues tratando datos personales y sigues necesitando una base jurídica y plazos de supresión, y deberías comprobar si el tratamiento tiene que entrar en vuestro registro de actividades de tratamiento. Con grabaciones habituales y con los tipos de datos del paso 1, ese es el caso normal.

Y luego el consentimiento, donde se suele tomar un atajo. La frase "voy a grabar esto" al principio de la conversación es información, no consentimiento. Quien después simplemente sigue hablando no ha aceptado, solo no ha protestado. El orden que sí se sostiene: informar, preguntar expresamente, esperar un sí claro, dejarlo anotado, y solo entonces empezar a grabar. Si alguien dice que no, no se graba, tampoco "solo para mí". En Alemania esto no es únicamente una cuestión de protección de datos: grabar la palabra hablada no pública sin permiso es delito según el artículo 201 del código penal alemán. En otros países las reglas son distintas, así que comprueba las de la tuya. Una grabación oculta sigue siendo oculta aunque acabe solo en tu disco duro.

Consejo: La separación limpia entre "no sale de casa" y "por eso está permitido" está desarrollada en IA local y el RGPD. Para el marco más amplio, incluida la Ley de IA, coge DACH legal, Ley de IA de la UE y RGPD.

10. Conviértelo en rutina, y comprueba las dos condiciones

Un proceso que rehaces cada vez desde cero se muere a la segunda semana. Crea una carpeta fija a la que vayan las grabaciones, y un bucle que pase la llamada del paso 5 por todo lo que hay dentro y deje los archivos de texto al lado:

for f in ~/transcripciones/entrada/*.wav; do
  whisper "$f" --model small --language German \
    --output_format txt --output_dir ~/transcripciones/hechas
done

Para empezar no hace falta más. El --output_format txt no es un adorno: sin él, Whisper escribe cada transcripción en todos los formatos, es decir cinco archivos por grabación. Con otro entorno de ejecución solo cambias la llamada del medio.

Y aquí llega la parte de la que depende toda la promesa. Que un modelo calcule en local no significa que el archivo se quede en local.

La primera condición es la carpeta. En Windows, OneDrive respalda si así se configura el escritorio, Documentos e Imágenes; en macOS, iCloud Drive guarda el escritorio y Documentos. Ese ajuste está a menudo ya activo sin que nadie lo haya puesto conscientemente. Una grabación que caiga ahí se va con la siguiente sincronización. Crea por eso la carpeta de trabajo expresamente fuera de las zonas sincronizadas, y mira en los ajustes de OneDrive, iCloud y Dropbox qué se está respaldando de verdad. Y ya de paso, acuérdate del programa de copias de seguridad que corre en segundo plano.

La segunda condición es el programa. Que una interfaz lleve whisper.cpp dentro no significa que no haga nada más. Puede enviar datos de uso, buscar actualizaciones o llamar a un servicio para funciones concretas. Desconecta por eso el ordenador de la red una vez y deja que pase una grabación. Si sale una transcripción completa, sabes que la transcripción en sí funciona sin conexión. Más que eso no sabes: un programa también puede retener un envío y recuperarlo la próxima vez que se conecte, y los sistemas operativos están hechos expresamente para eso. Si la confidencialidad tiene que sostenerse de verdad, bloquea el programa de forma permanente para las conexiones salientes o mantén todo el proceso desconectado de la red. En Windows eso significa una regla de bloqueo de salida en el cortafuegos, porque el tráfico saliente allí está permitido por defecto.

Mantén además el nombre del modelo en un único sitio y no repartido. Whisper ha recibido varias versiones desde su salida, la última large-v3 y turbo derivado de él, y esa evolución sigue. Quien escribe el nombre en cinco sitios deja de cambiarlo por pura comodidad.

Consejo: Mete el plazo de supresión directamente en el script. Las grabaciones que ya no necesita nadie no son un archivo, son un riesgo que crece en segundo plano.

Qué sigue

Si todavía no tienes ningún modelo local funcionando, Tu primer modelo de IA local en 30 minutos es la entrada, y la lección ¿Funciona la IA en mi ordenador? explica el principio que hay detrás. Si quieres saber si tu propio ordenador sale a cuenta frente a la nube, la cuenta está en Local o nube, la cuenta honesta. Y si después el modelo local debe conectarse a tus propias herramientas, MCP con modelos locales sigue el hilo.

Fuentes

Los tamaños de modelo, las necesidades de memoria y los datos de licencia proceden de la documentación oficial de Whisper, a fecha de agosto de 2026. La comparativa de velocidad es una medición del proyecto faster-whisper para el modelo small en un Core i7-12700K con ocho hilos, compara precisión completa con compresión de 8 bits y no se traslada uno a uno a otro hardware. Comprueba los valores actuales en la fuente.

  • Whisper, descripción de los modelos y licencia: https://github.com/openai/whisper
  • Whisper, texto de la licencia con la condición sobre la distribución: https://github.com/openai/whisper/blob/main/LICENSE
  • Whisper, ficha del modelo con historial de versiones: https://github.com/openai/whisper/blob/main/model-card.md
  • whisper.cpp, implementación en C/C++: https://github.com/ggml-org/whisper.cpp
  • faster-whisper, comparativa de velocidad: https://github.com/SYSTRAN/faster-whisper
  • CTranslate2, precisión con compresión de 8 bits: https://github.com/OpenNMT/CTranslate2/blob/master/docs/quantization.md
  • Microsoft, copia de seguridad de Escritorio y Documentos en OneDrive: https://support.microsoft.com/en-US/onedrive/back-up-your-folders-with-onedrive
  • Apple, Escritorio y Documentos en iCloud Drive: https://support.apple.com/es-es/109344
  • Artículo 201 del código penal alemán, vulneración de la confidencialidad de la palabra: https://www.gesetze-im-internet.de/englisch_stgb/englisch_stgb.html
  • Artículo 9 del RGPD, categorías especiales de datos personales: https://www.privacy-regulation.eu/es/9.htm
  • Artículo 30 del RGPD, registro de actividades de tratamiento y su excepción: https://www.privacy-regulation.eu/es/30.htm
Transcribir conversaciones sin conexión, sin que salgan de casa — StudioMeyer Academy