{"id":931,"date":"2026-06-05T15:15:48","date_gmt":"2026-06-05T18:15:48","guid":{"rendered":"https:\/\/www.ukrabot.cl\/blog\/?p=931"},"modified":"2026-07-14T17:57:26","modified_gmt":"2026-07-14T20:57:26","slug":"como-entrenar-un-modelo-de-voz-con-whisper-en-pi","status":"publish","type":"post","link":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/","title":{"rendered":"C\u00f3mo entrenar un modelo de voz con Whisper en Pi"},"content":{"rendered":"<h1 style=\"font-family:Arial,sans-serif;font-size:1.6em;color:#1a1a1a;line-height:1.3;margin:0 0 16px 0;\">Transcribir voz con Whisper en Raspberry Pi: qu\u00e9 modelo funciona y cu\u00e1l se queda corto<\/h1>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n\u00bfNecesitas transcribir reuniones, notas de voz o comandos de audio en espa\u00f1ol sin enviar nada a servidores externos?\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nEl modelo <strong>Whisper<\/strong> de OpenAI permite hacer reconocimiento de voz (<strong>ASR<\/strong>) completamente local. Pero hay una confusi\u00f3n com\u00fan: <strong>no se entrena en una Raspberry Pi<\/strong>. El entrenamiento de estos modelos requiere GPUs de datacenter y datasets de miles de horas. Lo que s\u00ed puedes hacer en una Pi es <strong>inferencia<\/strong>: cargar el modelo pre-entrenado y transcribir audio propio.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nA continuaci\u00f3n te mostramos qu\u00e9 variantes de Whisper corren en una Raspberry Pi 4, cu\u00e1nta RAM necesitan, cu\u00e1nto tardan en transcribir y c\u00f3mo instalarlas paso a paso.\n<\/p>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Entrenar vs inferir: la diferencia que importa<\/h2>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Entrenamiento (training):<\/strong> ajustar los millones de par\u00e1metros del modelo con datos de audio etiquetados. Requiere GPU NVIDIA A100 o similar, semanas de computaci\u00f3n y datasets masivos. No es viable en Raspberry Pi.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Inferencia (inference):<\/strong> usar el modelo ya entrenado para transcribir un archivo de audio nuevo. Es solo multiplicaci\u00f3n de matrices. En una Raspberry Pi 4 con <strong>whisper.cpp<\/strong> (versi\u00f3n C++ optimizada para CPU ARM) esto es perfectamente viable con los modelos peque\u00f1os.\n<\/p>\n<div style=\"border-left:4px solid #e63946;background:#fff5f5;padding:14px 16px;margin:20px 0;font-family:Arial,sans-serif;font-size:0.95em;color:#1a1a1a;\">\n<strong>\u26a0\ufe0f Dato que nadie te cuenta:<\/strong> el repositorio oficial de OpenAI en Python (<code>pip install openai-whisper<\/code>) es lent\u00edsimo en Raspberry Pi porque usa PyTorch sin optimizaciones ARM. La versi\u00f3n que funciona es <strong>whisper.cpp<\/strong>, una reimplementaci\u00f3n en C++ que usa instrucciones <strong>ARM NEON<\/strong> y es 5-10 veces m\u00e1s r\u00e1pida en la misma hardware.\n<\/div>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Comparativa de modelos Whisper en Raspberry Pi 4<\/h2>\n<table style=\"width:100%;border-collapse:collapse;margin:24px 0;font-size:0.95em;font-family:Arial,sans-serif;\">\n<thead>\n<tr style=\"background:#f0f4f8;\">\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Modelo<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Par\u00e1metros<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Archivo GGML<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">RAM usada<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Tiempo en Pi 4 (100s audio)<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Velocidad vs tiempo real<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Uso recomendado<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td style=\"border:1px solid #ccc;padding:10px;\">tiny<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">39 M<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">75 MB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~273 MB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~35 segundos<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\"><strong>2,85\u00d7<\/strong> (m\u00e1s r\u00e1pido)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Comandos de voz, notas cortas. Precisi\u00f3n baja.<\/td>\n<\/tr>\n<tr style=\"background:#fafafa;\">\n<td style=\"border:1px solid #ccc;padding:10px;\">base<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">74 M<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">142 MB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~388 MB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~53 segundos<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\"><strong>1,88\u00d7<\/strong> (m\u00e1s r\u00e1pido)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Transcripci\u00f3n en tiempo real. Buen equilibrio.<\/td>\n<\/tr>\n<tr>\n<td style=\"border:1px solid #ccc;padding:10px;\">small<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">244 M<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">466 MB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~852 MB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~2 min 16 s<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\"><strong>0,73\u00d7<\/strong> (m\u00e1s lento)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Batch nocturno. Precisi\u00f3n notablemente mejor.<\/td>\n<\/tr>\n<tr style=\"background:#fafafa;\">\n<td style=\"border:1px solid #ccc;padding:10px;\">medium<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">769 M<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">1,5 GB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~2,1 GB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~5 min 52 s<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\"><strong>0,28\u00d7<\/strong> (mucho m\u00e1s lento)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Requiere Pi 4 de 4-8 GB. Batch \u00fanicamente.<\/td>\n<\/tr>\n<tr>\n<td style=\"border:1px solid #ccc;padding:10px;\">large-v3<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">1.550 M<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">2,9 GB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~3,9 GB<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">~10 min 51 s<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\"><strong>0,15\u00d7<\/strong> (impracticable)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Solo Pi 4 8GB o Pi 5. No usable en tiempo real.<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nLos tiempos son para whisper.cpp en Raspberry Pi 4 (4 n\u00facleos ARM Cortex-A72 @ 1,5 GHz), sin GUI, usando los 4 threads disponibles. El modelo <strong>base<\/strong> es el punto dulce para la mayor\u00eda de proyectos en espa\u00f1ol.\n<\/p>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Instalaci\u00f3n paso a paso de whisper.cpp en Raspberry Pi<\/h2>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nEstos comandos funcionan en Raspberry Pi OS (Bookworm o Bullseye) y asumen que ya tienes acceso SSH o terminal.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Paso 1: Instalar dependencias.<\/strong>\n<\/p>\n<pre style=\"background:#1e1e1e;color:#d4d4d4;padding:16px;border-radius:6px;overflow-x:auto;font-size:0.9em;font-family:monospace;margin:20px 0;\">\nsudo apt update\nsudo apt install -y git build-essential libsdl2-dev\n<\/pre>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Paso 2: Clonar whisper.cpp y compilar.<\/strong>\n<\/p>\n<pre style=\"background:#1e1e1e;color:#d4d4d4;padding:16px;border-radius:6px;overflow-x:auto;font-size:0.9em;font-family:monospace;margin:20px 0;\">\ngit clone https:\/\/github.com\/ggerganov\/whisper.cpp.git\ncd whisper.cpp\nmake -j4\n<\/pre>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Paso 3: Descargar el modelo base (u otro).<\/strong>\n<\/p>\n<pre style=\"background:#1e1e1e;color:#d4d4d4;padding:16px;border-radius:6px;overflow-x:auto;font-size:0.9em;font-family:monospace;margin:20px 0;\">\nbash models\/download-ggml-model.sh base\n<\/pre>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Paso 4: Convertir tu audio a WAV 16 kHz mono.<\/strong> Whisper solo acepta este formato.\n<\/p>\n<pre style=\"background:#1e1e1e;color:#d4d4d4;padding:16px;border-radius:6px;overflow-x:auto;font-size:0.9em;font-family:monospace;margin:20px 0;\">\nffmpeg -i tu_audio.mp3 -ar 16000 -ac 1 -c:a pcm_s16le tu_audio.wav\n<\/pre>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>Paso 5: Transcribir en espa\u00f1ol.<\/strong>\n<\/p>\n<pre style=\"background:#1e1e1e;color:#d4d4d4;padding:16px;border-radius:6px;overflow-x:auto;font-size:0.9em;font-family:monospace;margin:20px 0;\">\n.\/main -m models\/ggml-base.bin -f tu_audio.wav -l es -t 4 -otxt\n<\/pre>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nEl par\u00e1metro <code>-l es<\/code> fuerza el idioma espa\u00f1ol. <code>-t 4<\/code> usa los 4 n\u00facleos de la Pi 4. <code>-otxt<\/code> genera un archivo de texto plano con la transcripci\u00f3n.\n<\/p>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">5 errores costosos al usar Whisper en Raspberry Pi<\/h2>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>1. Instalar el paquete Python <code>openai-whisper<\/code> en la Pi.<\/strong> Ese paquete depende de PyTorch, que ocupa m\u00e1s de 600 MB y no est\u00e1 optimizado para ARM. La inferencia es 5-10 veces m\u00e1s lenta que whisper.cpp. Usa siempre whisper.cpp en Raspberry Pi.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>2. Intentar cargar medium o large en una Pi 4 de 2 GB.<\/strong> El modelo medium requiere 2,1 GB de RAM. En una Pi 4 de 2 GB el sistema operativo ya consume 800 MB. El modelo no carga y el proceso es killado por el kernel (OOM). Usa tiny o base en Pis de 2-4 GB.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>3. Pasar audio en formato MP3 o est\u00e9reo directamente.<\/strong> Whisper.cpp no decodifica MP3 ni acepta est\u00e9reo. Si le pasas un MP3 directamente, el resultado es basura o error de segmentaci\u00f3n. Convierte siempre a WAV 16 kHz mono con ffmpeg.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>4. No especificar el idioma.<\/strong> Si omites <code>-l es<\/code>, Whisper intenta detectar el idioma autom\u00e1ticamente en los primeros 30 segundos. En audio corto o con acentos regionales chilenos, a veces detecta incorrectamente portugu\u00e9s o catal\u00e1n. Fuerza <code>-l es<\/code> para espa\u00f1ol.\n<\/p>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<strong>5. Correr la transcripci\u00f3n con la GUI de Raspberry Pi activa.<\/strong> El escritorio gr\u00e1fico consume 300-500 MB de RAM y ciclos de CPU. Para transcripci\u00f3n batch, ejecuta en modo <strong>headless<\/strong> (sin monitor) o desde la terminal (Ctrl+Alt+F1) para liberar recursos.\n<\/p>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Raspberry Pi 4 vs Pi 5 vs PC: d\u00f3nde transcribir<\/h2>\n<table style=\"width:100%;border-collapse:collapse;margin:24px 0;font-size:0.95em;font-family:Arial,sans-serif;\">\n<thead>\n<tr style=\"background:#f0f4f8;\">\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Hardware<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Precio aprox. CLP<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Modelo viable<\/th>\n<th style=\"border:1px solid #ccc;padding:10px;text-align:left;color:#1a1a1a;\">Uso recomendado<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td style=\"border:1px solid #ccc;padding:10px;\">Raspberry Pi 4 (2 GB)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">$90.000 &#8211; $120.000<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">tiny, base<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Comandos de voz, transcripci\u00f3n batch peque\u00f1a.<\/td>\n<\/tr>\n<tr style=\"background:#fafafa;\">\n<td style=\"border:1px solid #ccc;padding:10px;\">Raspberry Pi 4 (4-8 GB)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">$108.000 &#8211; $240.000<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">tiny, base, small<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Transcripci\u00f3n de reuniones, podcasts, notas de voz.<\/td>\n<\/tr>\n<tr>\n<td style=\"border:1px solid #ccc;padding:10px;\">Raspberry Pi 5 (8 GB)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">$150.000 &#8211; $280.000<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">tiny, base, small, medium<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Proyectos de voz en tiempo real con mejor precisi\u00f3n.<\/td>\n<\/tr>\n<tr style=\"background:#fafafa;\">\n<td style=\"border:1px solid #ccc;padding:10px;\">PC con GPU NVIDIA<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">$400.000+<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Todos (large, turbo)<\/td>\n<td style=\"border:1px solid #ccc;padding:10px;\">Transcripci\u00f3n masiva, fine-tuning, producci\u00f3n.<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<div style=\"border-left:4px solid #0057e7;background:#f5f8ff;padding:14px 16px;margin:20px 0;font-family:Arial,sans-serif;font-size:0.95em;color:#1a1a1a;\">\n<strong>\ud83d\udca1 Conclusi\u00f3n pr\u00e1ctica:<\/strong> si tu objetivo es transcribir notas de voz o crear un asistente de comandos en espa\u00f1ol con una Raspberry Pi 4, usa el modelo <strong>base<\/strong> con <strong>whisper.cpp<\/strong>. Es 1,88 veces m\u00e1s r\u00e1pido que el audio de entrada, ocupa menos de 400 MB de RAM y la precisi\u00f3n es suficiente para la mayor\u00eda de aplicaciones dom\u00e9sticas. Si necesitas transcribir textos t\u00e9cnicos o legales con m\u00ednimo error, salta a una PC con GPU.\n<\/div>\n<div style=\"text-align:center;margin:28px 0;\">\n<a href=\"https:\/\/www.ukrabot.cl\/producto\/raspberry-pi-4-modelo-b-4gb\/\" style=\"display:inline-block;background:#0057e7;color:#fff;font-family:Arial,sans-serif;font-size:1em;text-decoration:none;padding:14px 28px;border-radius:6px;\">Ver Raspberry Pi 4 en Ukrabot Chile<\/a>\n<\/div>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Caso pr\u00e1ctico: transcribir notas de voz de 10 minutos<\/h2>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nImagina que grabaste una reuni\u00f3n de 10 minutos en tu celular en formato AAC. El flujo de trabajo en Raspberry Pi 4 ser\u00eda:\n<\/p>\n<ol style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;padding-left:20px;\">\n<li>Transferir el archivo a la Pi v\u00eda SCP o pendrive USB.<\/li>\n<li>Convertir: <code>ffmpeg -i reunion.m4a -ar 16000 -ac 1 reunion.wav<\/code> (toma 5 segundos).<\/li>\n<li>Transcribir con base: <code>.\/main -m models\/ggml-base.bin -f reunion.wav -l es -t 4 -otxt<\/code> (toma ~5 minutos).<\/li>\n<li>Revisar el archivo <code>reunion.wav.txt<\/code> generado autom\u00e1ticamente.<\/li>\n<\/ol>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nEl resultado es un archivo de texto con la transcripci\u00f3n completa, timestamps incluidos si agregas <code>-osrt<\/code> en lugar de <code>-otxt<\/code>.\n<\/p>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Tambi\u00e9n te puede interesar<\/h2>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\n<a href=\"https:\/\/www.ukrabot.cl\/producto\/raspberry-pi-4-modelo-b-4gb\/\" style=\"color:#0057e7;text-decoration:underline;\">Raspberry Pi 4 4GB<\/a> |<br \/>\n<a href=\"https:\/\/www.ukrabot.cl\/producto\/raspberry-pi-5-8gb\/\" style=\"color:#0057e7;text-decoration:underline;\">Raspberry Pi 5 8GB<\/a> |<br \/>\n<a href=\"https:\/\/www.ukrabot.cl\/producto\/micro-sd-64gb\/\" style=\"color:#0057e7;text-decoration:underline;\">Micro SD 64GB<\/a> |<br \/>\n<a href=\"https:\/\/www.ukrabot.cl\/producto\/camara-raspberry-pi-hq\/\" style=\"color:#0057e7;text-decoration:underline;\">C\u00e1mara Raspberry Pi HQ<\/a> |<br \/>\n<a href=\"https:\/\/www.ukrabot.cl\/blog\/\" style=\"color:#0057e7;text-decoration:underline;\">Gu\u00edas t\u00e9cnicas Raspberry Pi<\/a>\n<\/p>\n<h2 style=\"font-family:Arial,sans-serif;font-size:1.25em;color:#1a1a1a;margin:28px 0 12px 0;\">Preguntas frecuentes sobre Whisper en Raspberry Pi<\/h2>\n<h3 style=\"font-family:Arial,sans-serif;font-size:1.05em;color:#1a1a1a;margin:18px 0 8px 0;\">\u00bfSe puede entrenar Whisper en una Raspberry Pi?<\/h3>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nNo. El entrenamiento o fine-tuning de Whisper requiere GPUs potentes (NVIDIA A100 o similar) y datasets de miles de horas. En una Raspberry Pi solo puedes ejecutar <strong>inferencia<\/strong>: usar el modelo ya entrenado para transcribir audio.\n<\/p>\n<h3 style=\"font-family:Arial,sans-serif;font-size:1.05em;color:#1a1a1a;margin:18px 0 8px 0;\">\u00bfQu\u00e9 modelo de Raspberry Pi necesito como m\u00ednimo?<\/h3>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nUna <strong>Raspberry Pi 4 de 2 GB<\/strong> es suficiente para los modelos tiny y base. Para small necesitas al menos <strong>4 GB<\/strong>. Para medium, m\u00ednimo <strong>4 GB<\/strong> pero recomendado <strong>8 GB<\/strong>. El modelo large-v3 solo es viable en Pi 4 8GB o Pi 5, aunque muy lento.\n<\/p>\n<h3 style=\"font-family:Arial,sans-serif;font-size:1.05em;color:#1a1a1a;margin:18px 0 8px 0;\">\u00bfWhisper funciona bien con el espa\u00f1ol de Chile?<\/h3>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nS\u00ed. Whisper fue entrenado con datos multiling\u00fces que incluyen espa\u00f1ol de Latinoam\u00e9rica. El modelo <strong>base<\/strong> transcribe correctamente modismos chilenos comunes. Para t\u00e9rminos t\u00e9cnicos muy espec\u00edficos, el modelo <strong>small<\/strong> reduce errores. Siempre fuerza el idioma con <code>-l es<\/code>.\n<\/p>\n<h3 style=\"font-family:Arial,sans-serif;font-size:1.05em;color:#1a1a1a;margin:18px 0 8px 0;\">\u00bfPuedo hacer transcripci\u00f3n en tiempo real (streaming)?<\/h3>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nCon el modelo <strong>tiny<\/strong> o <strong>base<\/strong> en whisper.cpp usando el flag <code>--stream<\/code>, s\u00ed. La latencia es de 0,5 a 2 segundos respecto al habla. Requiere un micr\u00f3fono USB de buena calidad y una Pi 4 de 4 GB o superior.\n<\/p>\n<h3 style=\"font-family:Arial,sans-serif;font-size:1.05em;color:#1a1a1a;margin:18px 0 8px 0;\">\u00bfCu\u00e1nto consume de electricidad una Pi 4 transcribiendo con Whisper?<\/h3>\n<p style=\"font-family:Arial,sans-serif;font-size:1em;color:#333;line-height:1.6;margin:0 0 12px 0;\">\nUna Raspberry Pi 4 en carga completa consume aproximadamente <strong>7,5 W<\/strong> (1,5 A a 5V). Transcribir 10 minutos de audio con el modelo base consume menos de <strong>1 Wh<\/strong> de energ\u00eda. En t\u00e9rminos de costo el\u00e9ctrico en Chile, es insignificante frente a enviar el audio a un servicio en la nube.\n<\/p>\n<p><script type=\"application\/ld+json\">\n{\n  \"@context\": \"https:\/\/schema.org\",\n  \"@type\": \"FAQPage\",\n  \"mainEntity\": [\n    {\n      \"@type\": \"Question\",\n      \"name\": \"\u00bfSe puede entrenar Whisper en una Raspberry Pi?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"No. El entrenamiento o fine-tuning de Whisper requiere GPUs potentes (NVIDIA A100 o similar) y datasets de miles de horas. En una Raspberry Pi solo puedes ejecutar inferencia: usar el modelo ya entrenado para transcribir audio.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"\u00bfQu\u00e9 modelo de Raspberry Pi necesito como m\u00ednimo?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Una Raspberry Pi 4 de 2 GB es suficiente para los modelos tiny y base. Para small necesitas al menos 4 GB. Para medium, m\u00ednimo 4 GB pero recomendado 8 GB. El modelo large-v3 solo es viable en Pi 4 8GB o Pi 5, aunque muy lento.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"\u00bfWhisper funciona bien con el espa\u00f1ol de Chile?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"S\u00ed. Whisper fue entrenado con datos multiling\u00fces que incluyen espa\u00f1ol de Latinoam\u00e9rica. El modelo base transcribe correctamente modismos chilenos comunes. Para t\u00e9rminos t\u00e9cnicos muy espec\u00edficos, el modelo small reduce errores. Siempre fuerza el idioma con -l es.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"\u00bfPuedo hacer transcripci\u00f3n en tiempo real (streaming)?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Con el modelo tiny o base en whisper.cpp usando el flag --stream, s\u00ed. La latencia es de 0,5 a 2 segundos respecto al habla. Requiere un micr\u00f3fono USB de buena calidad y una Pi 4 de 4 GB o superior.\"\n      }\n    },\n    {\n      \"@type\": \"Question\",\n      \"name\": \"\u00bfCu\u00e1nto consume de electricidad una Pi 4 transcribiendo con Whisper?\",\n      \"acceptedAnswer\": {\n        \"@type\": \"Answer\",\n        \"text\": \"Una Raspberry Pi 4 en carga completa consume aproximadamente 7,5 W (1,5 A a 5V). Transcribir 10 minutos de audio con el modelo base consume menos de 1 Wh de energ\u00eda. En t\u00e9rminos de costo el\u00e9ctrico en Chile, es insignificante frente a enviar el audio a un servicio en la nube.\"\n      }\n    }\n  ]\n}\n<\/script><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[9],"tags":[5,7,6,3,2,34,748],"class_list":["post-931","post","type-post","status-publish","format-standard","hentry","category-blog","tag-electronica","tag-inteligencia-artificial","tag-maker","tag-raspberry-pi","tag-robotica","tag-voz","tag-whisper"],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v27.7 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>C\u00f3mo entrenar un modelo de voz con Whisper en Pi | UKRABOT<\/title>\n<meta name=\"description\" content=\"Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/\" \/>\n<meta property=\"og:locale\" content=\"es_ES\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"C\u00f3mo entrenar un modelo de voz con Whisper en Pi | UKRABOT\" \/>\n<meta property=\"og:description\" content=\"Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica\" \/>\n<meta property=\"og:url\" content=\"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/\" \/>\n<meta property=\"og:site_name\" content=\"BLOG UKRABOT\" \/>\n<meta property=\"article:published_time\" content=\"2026-06-05T18:15:48+00:00\" \/>\n<meta property=\"article:modified_time\" content=\"2026-07-14T20:57:26+00:00\" \/>\n<meta name=\"author\" content=\"toti\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"Escrito por\" \/>\n\t<meta name=\"twitter:data1\" content=\"toti\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/\"},\"author\":{\"name\":\"toti\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#\\\/schema\\\/person\\\/3f2381f14be22ae1a19c3aad3c723747\"},\"headline\":\"C\u00f3mo entrenar un modelo de voz con Whisper en Pi\",\"datePublished\":\"2026-06-05T18:15:48+00:00\",\"dateModified\":\"2026-07-14T20:57:26+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/\"},\"wordCount\":1251,\"commentCount\":0,\"publisher\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#organization\"},\"keywords\":[\"electr\u00f3nica\",\"inteligencia artificial\",\"maker\",\"Raspberry Pi\",\"rob\u00f3tica\",\"voz\",\"whisper\"],\"articleSection\":[\"Blog\"],\"inLanguage\":\"es-CL\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/#respond\"]}]},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/\",\"url\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/\",\"name\":\"C\u00f3mo entrenar un modelo de voz con Whisper en Pi | UKRABOT\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#website\"},\"datePublished\":\"2026-06-05T18:15:48+00:00\",\"dateModified\":\"2026-07-14T20:57:26+00:00\",\"description\":\"Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/#breadcrumb\"},\"inLanguage\":\"es-CL\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/\"]}]},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Portada\",\"item\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"C\u00f3mo entrenar un modelo de voz con Whisper en Pi\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#website\",\"url\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/\",\"name\":\"BLOG UKRABOT\",\"description\":\"\",\"publisher\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#organization\"},\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"es-CL\"},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#organization\",\"name\":\"BLOG UKRABOT\",\"url\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/\",\"logo\":{\"@type\":\"ImageObject\",\"inLanguage\":\"es-CL\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#\\\/schema\\\/logo\\\/image\\\/\",\"url\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/wp-content\\\/uploads\\\/2026\\\/04\\\/ukrabot-logo-1.webp\",\"contentUrl\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/wp-content\\\/uploads\\\/2026\\\/04\\\/ukrabot-logo-1.webp\",\"width\":294,\"height\":58,\"caption\":\"BLOG UKRABOT\"},\"image\":{\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#\\\/schema\\\/logo\\\/image\\\/\"}},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/#\\\/schema\\\/person\\\/3f2381f14be22ae1a19c3aad3c723747\",\"name\":\"toti\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"es-CL\",\"@id\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/db80c4e922a02a921cfbd9dfe3b8de20fc0edb3ba84799833e52e2e60fca6702?s=96&d=mm&r=g\",\"url\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/db80c4e922a02a921cfbd9dfe3b8de20fc0edb3ba84799833e52e2e60fca6702?s=96&d=mm&r=g\",\"contentUrl\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/db80c4e922a02a921cfbd9dfe3b8de20fc0edb3ba84799833e52e2e60fca6702?s=96&d=mm&r=g\",\"caption\":\"toti\"},\"sameAs\":[\"https:\\\/\\\/www.ukrabot.cl\\\/blog\"],\"url\":\"https:\\\/\\\/www.ukrabot.cl\\\/blog\\\/author\\\/toti\\\/\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"C\u00f3mo entrenar un modelo de voz con Whisper en Pi | UKRABOT","description":"Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/","og_locale":"es_ES","og_type":"article","og_title":"C\u00f3mo entrenar un modelo de voz con Whisper en Pi | UKRABOT","og_description":"Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica","og_url":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/","og_site_name":"BLOG UKRABOT","article_published_time":"2026-06-05T18:15:48+00:00","article_modified_time":"2026-07-14T20:57:26+00:00","author":"toti","twitter_card":"summary_large_image","twitter_misc":{"Escrito por":"toti"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/#article","isPartOf":{"@id":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/"},"author":{"name":"toti","@id":"https:\/\/www.ukrabot.cl\/blog\/#\/schema\/person\/3f2381f14be22ae1a19c3aad3c723747"},"headline":"C\u00f3mo entrenar un modelo de voz con Whisper en Pi","datePublished":"2026-06-05T18:15:48+00:00","dateModified":"2026-07-14T20:57:26+00:00","mainEntityOfPage":{"@id":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/"},"wordCount":1251,"commentCount":0,"publisher":{"@id":"https:\/\/www.ukrabot.cl\/blog\/#organization"},"keywords":["electr\u00f3nica","inteligencia artificial","maker","Raspberry Pi","rob\u00f3tica","voz","whisper"],"articleSection":["Blog"],"inLanguage":"es-CL","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/#respond"]}]},{"@type":"WebPage","@id":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/","url":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/","name":"C\u00f3mo entrenar un modelo de voz con Whisper en Pi | UKRABOT","isPartOf":{"@id":"https:\/\/www.ukrabot.cl\/blog\/#website"},"datePublished":"2026-06-05T18:15:48+00:00","dateModified":"2026-07-14T20:57:26+00:00","description":"Aprende a entrenar un modelo de voz con Whisper en Raspberry Pi para proyectos de rob\u00f3tica y electr\u00f3nica","breadcrumb":{"@id":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/#breadcrumb"},"inLanguage":"es-CL","potentialAction":[{"@type":"ReadAction","target":["https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/"]}]},{"@type":"BreadcrumbList","@id":"https:\/\/www.ukrabot.cl\/blog\/como-entrenar-un-modelo-de-voz-con-whisper-en-pi\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Portada","item":"https:\/\/www.ukrabot.cl\/blog\/"},{"@type":"ListItem","position":2,"name":"C\u00f3mo entrenar un modelo de voz con Whisper en Pi"}]},{"@type":"WebSite","@id":"https:\/\/www.ukrabot.cl\/blog\/#website","url":"https:\/\/www.ukrabot.cl\/blog\/","name":"BLOG UKRABOT","description":"","publisher":{"@id":"https:\/\/www.ukrabot.cl\/blog\/#organization"},"potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/www.ukrabot.cl\/blog\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"es-CL"},{"@type":"Organization","@id":"https:\/\/www.ukrabot.cl\/blog\/#organization","name":"BLOG UKRABOT","url":"https:\/\/www.ukrabot.cl\/blog\/","logo":{"@type":"ImageObject","inLanguage":"es-CL","@id":"https:\/\/www.ukrabot.cl\/blog\/#\/schema\/logo\/image\/","url":"https:\/\/www.ukrabot.cl\/blog\/wp-content\/uploads\/2026\/04\/ukrabot-logo-1.webp","contentUrl":"https:\/\/www.ukrabot.cl\/blog\/wp-content\/uploads\/2026\/04\/ukrabot-logo-1.webp","width":294,"height":58,"caption":"BLOG UKRABOT"},"image":{"@id":"https:\/\/www.ukrabot.cl\/blog\/#\/schema\/logo\/image\/"}},{"@type":"Person","@id":"https:\/\/www.ukrabot.cl\/blog\/#\/schema\/person\/3f2381f14be22ae1a19c3aad3c723747","name":"toti","image":{"@type":"ImageObject","inLanguage":"es-CL","@id":"https:\/\/secure.gravatar.com\/avatar\/db80c4e922a02a921cfbd9dfe3b8de20fc0edb3ba84799833e52e2e60fca6702?s=96&d=mm&r=g","url":"https:\/\/secure.gravatar.com\/avatar\/db80c4e922a02a921cfbd9dfe3b8de20fc0edb3ba84799833e52e2e60fca6702?s=96&d=mm&r=g","contentUrl":"https:\/\/secure.gravatar.com\/avatar\/db80c4e922a02a921cfbd9dfe3b8de20fc0edb3ba84799833e52e2e60fca6702?s=96&d=mm&r=g","caption":"toti"},"sameAs":["https:\/\/www.ukrabot.cl\/blog"],"url":"https:\/\/www.ukrabot.cl\/blog\/author\/toti\/"}]}},"_links":{"self":[{"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/posts\/931","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/comments?post=931"}],"version-history":[{"count":3,"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/posts\/931\/revisions"}],"predecessor-version":[{"id":1041,"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/posts\/931\/revisions\/1041"}],"wp:attachment":[{"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/media?parent=931"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/categories?post=931"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.ukrabot.cl\/blog\/wp-json\/wp\/v2\/tags?post=931"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}