La nueva generación de modelos open source obliga a replantear el análisis forense de audio

Introducción

Durante años, la mayoría de los sistemas de clonación de voz dependían de servicios en la nube. Plataformas como ElevenLabs, Azure Speech o Google almacenaban registros de actividad, aplicaban determinadas políticas de uso y, en algunos casos, incorporaban mecanismos de trazabilidad o marcas de agua digitales.

Ese escenario está desapareciendo.

En apenas unos meses han aparecido modelos de código abierto capaces de ejecutarse íntegramente en un ordenador doméstico, sin necesidad de conexión a Internet, sin registros de actividad y sin intervención de ningún proveedor.

La consecuencia es evidente: la desaparición de prácticamente cualquier evidencia externa sobre el proceso de generación del audio.

Ya no hablamos únicamente de deepfakes de voz más realistas.

Hablamos de deepfakes que nacen sin dejar huella.

Del «deepfake en la nube» al «deepfake invisible»

Hace apenas dos años, generar una voz sintética de calidad profesional exigía utilizar servicios online.Hoy el escenario es completamente diferente.

Modelos como:

  • Qwen3-TTS
  • OpenAudio S1
  • CosyVoice 2
  • GPT-SoVITS
  • F5-TTS
  • XTTS v2
  • Chatterbox
  • RVC

pueden descargarse gratuitamente y ejecutarse localmente, eliminando prácticamente cualquier dependencia externa.

Para un investigador forense esto supone un cambio mucho más importante que el incremento de calidad de la voz.

Significa que:

  • no existen logs del proveedor,
  • no existen peticiones API,
  • no existen cuentas de usuario,
  • no existe historial de generación.

La única evidencia disponible será el propio archivo de audio. Y precisamente ahí comienza el trabajo del laboratorio de audio forense.

Operación invisible: Cómo un atacante profesional elimina toda traza digital

Hace apenas dos años, generar una voz sintética de calidad profesional exigía utilizar servicios online. Hoy el escenario es completamente diferente.

Modelos como:

  • Qwen3-TTS
  • OpenAudio S1
  • CosyVoice 2
  • GPT-SoVITS
  • F5-TTS
  • XTTS v2
  • Chatterbox
  • RVC

pueden descargarse gratuitamente y ejecutarse localmente, eliminando prácticamente cualquier dependencia externa.

Para un investigador forense esto supone un cambio mucho más importante que el incremento de calidad de la voz.

El cambio de APIs en la nube a generación local transforma fundamentalmente el cálculo forense. Cuando el audio se genera a través de servicios comerciales como Resemble, ElevenLabs u OpenAI, los proveedores mantienen registros de generación, incrustan marcas de agua, aplican moderación de contenido y pueden responder a requerimientos judiciales. El despliegue local elimina cada una de estas salvaguardas.

  • Arquitectura air-gapped: sin conexión, sin rastro

El principio operativo fundamental es el aislamiento total de la red. Un atacante profesional con recursos configura su estación de trabajo de la siguiente manera:

Descarga inicial y única: los modelos se descargan una sola vez desde HuggingFace o repositorios de GitHub. Para máxima anonimización, la descarga se realiza a través de VPN multicapa o red Tor, desde un dispositivo desechable (por ejemplo, un Live USB de Tails) en una red WiFi pública. Los pesos del modelo se transfieren a la estación de trabajo de clonación mediante soporte físico (USB cifrado). Una vez transferidos, la máquina de clonación no vuelve a conectarse a internet.

Sistema operativo endurecido: distribuciones Linux como Tails (amnésico, ejecuta todo en RAM), Whonix (aislamiento por virtualización) o Qubes OS (compartimentalización por máquinas virtuales) proporcionan capas de aislamiento. Los atacantes más sofisticados utilizan un sistema base Linux minimal (Arch, Void) con cifrado completo de disco (LUKS) y sin servicios de red habilitados, ejecutando los modelos de IA directamente sobre el hardware sin capa de contenedorización que pueda dejar logs.

Eliminación de telemetría: los frameworks de IA (PyTorch, TensorFlow) incluyen por defecto telemetría y comprobaciones de actualizaciones. Un atacante profesional compila PyTorch desde código fuente con estas funciones deshabilitadas, o utiliza variables de entorno (TORCH_HOME, HF_DATASETS_OFFLINE=1, TRANSFORMERS_OFFLINE=1) para forzar operación completamente offline. Los permisos de firewall a nivel de kernel (iptables/nftables) bloquean toda comunicación saliente como capa adicional de seguridad.

Almacenamiento volátil: los audios generados pueden procesarse enteramente en RAM (usando tmpfs en Linux) sin que toquen jamás el disco duro. Cuando se almacenan, se utiliza cifrado AES-256 con claves efímeras. Los contenedores cifrados (VeraCrypt) con volúmenes ocultos proporcionan negabilidad plausible. El borrado seguro del espacio libre se ejecuta automáticamente al apagar el sistema.

  • Personalización del modelo: alteración de firmas espectrales

Más allá del aislamiento físico, un atacante sofisticado modifica el propio modelo para dificultar la atribución forense:

Fine-tuning con datos propios: al reentrenar el modelo con un dataset personalizado (incluso pequeño, de 30-60 minutos de audio), las distribuciones de pesos del modelo cambian, alterando las “huellas dactilares” espectrales que los detectores forenses aprenden a reconocer. El challenge ASVspoof 5 (2024) confirmó que los detectores entrenados en tipos de ataque específicos experimentan incrementos de tasa de error de 10-40 puntos porcentuales cuando se enfrentan a métodos de generación no vistos durante el entrenamiento.

Sustitución del vocoder: reemplazar el vocoder por defecto (HiFi-GAN, BigVGAN) por una alternativa o una versión personalizada modifica la firma espectral residual del audio generado. Los detectores forenses que dependen de fingerprints de vocoders conocidos pierden eficacia.

Ensemble de modelos: combinar la salida de múltiples modelos (por ejemplo, generar con Qwen3-TTS y post-procesar con RVC) crea un audio cuyas características no corresponden a ningún modelo individual, dificultando enormemente la atribución.

 

  • Obtención de muestras de voz: el problema resuelto

Para el atacante profesional, obtener los 3-10 segundos de audio de referencia necesarios para la clonación ha dejado de ser un obstáculo. Las fuentes disponibles incluyen:

Fuentes públicas: entrevistas en YouTube, apariciones en podcasts, vídeos de LinkedIn, conferencias grabadas, earnings calls corporativos (que proporcionan audio de calidad estudio de directivos). Una sola aparición pública proporciona más audio del necesario.

Fuentes de ingeniería social: como documentó el National Trading Standards del Reino Unido en febrero de 2026, los atacantes realizan llamadas frías simulando encuestas y graban las respuestas de la víctima. Un buzón de voz (típicamente 5-10 segundos) es suficiente para modelos como Qwen3-TTS. Los estafadores compran números de teléfono en brokers de datos y llaman para capturar el saludo del buzón.

Fuentes del entorno personal: como demostró el caso del instituto de Madrid, una simple nota de voz de WhatsApp en un chat familiar proporciona material de referencia perfecto. Cualquier entorno doméstico o laboral contiene grabaciones informales que superan con creces el mínimo requerido.

  • Post-procesamiento anti-Audio forense: Barreras para la detección

La fase más crítica del arsenal del atacante es el post-procesamiento del audio generado para dificultar su detección como sintético. La investigación publicada en IEEE (2024) documentó cómo estas técnicas afectan a los detectores de última generación:

Técnica de re-play (reproducir el audio por altavoces y re-grabar con micrófono real).

Ambiente acústico: Añadir reverberación para simular un espacio real al audio sintético.

Adición de ruido ambiental: Superponer ruido de fondo auténtico (tráfico, oficina, calle).

Simulación de canal telefónico: Filtrar a banda estrecha (300-3400 Hz) + ruido de línea.

Recodificación y conversión de formato multiple: WAV → MP3 → OGG → WAV (pérdida acumulativa).

Cada una de estas técnicas introduce nuevas variables que pueden enmascarar parte de los artefactos de síntesis, obligando a los laboratorios de audio forense a actualizar continuamente sus metodologías de análisis.

¿Significa esto que ya no pueden detectarse?

En absoluto.

Lo que significa es que ya no basta con el análisis de autenticidad que proponen los diferentes estándares y comunidad de expertos (IAFPA, SWGDE, ENFSI). Más allá del análisis binario y  metadatos, la detección moderna exige combinar múltiples procedimientos y disciplinas: :

  • Análisis en el dominio de la amplitud y frecuencia (espectrograma de alta resolución, energia y análisis FFT)
  • Análisis acústico vocal (extracción de parámetros biométricos como jitter, shimer y HNR)
  • Análisis de continuidad, fase acústica y DC offset
  • Identificación de códecs y recodificación digital
  • Análisis de rasgos suprasegmentales (entonación, prosodia y rasgos de habla espontánea)
  • Composición espectral del ruido ambiente y variabilidad en el tiempo.
  • Extracción de tiempo de reverberación y persistencia de la fuente sonora.
  • Extracción de coeficientes estadístico de verosimilitud (Likelihood ratio)sobre trazas de síntesis vocal y análisis de spoofgrama.

Ninguna técnica aislada ofrece garantías suficientes. La fortaleza reside en la convergencia de evidencias.

¿Significa esto que ya no pueden detectarse?

En absoluto.

Lo que significa es que ya no basta con el análisis de autenticidad que proponen los diferentes estándares y comunidad de expertos (IAFPA, SWGDE, ENFSI). Más allá del análisis binario y  metadatos, la detección moderna exige combinar múltiples procedimientos y disciplinas: :

  • Análisis en el dominio de la amplitud y frecuencia (espectrograma de alta resolución, energia y análisis FFT)
  • Análisis acústico vocal (extracción de parámetros biométricos como jitter, shimer y HNR)
  • Análisis de continuidad, fase acústica y DC offset
  • Identificación de códecs y recodificación digital
  • Análisis de rasgos suprasegmentales (entonación, prosodia y rasgos de habla espontánea)
  • Composición espectral del ruido ambiente y variabilidad en el tiempo.
  • Extracción de tiempo de reverberación y persistencia de la fuente sonora.
  • Extracción de coeficientes estadístico de verosimilitud (Likelihood ratio)sobre trazas de síntesis vocal y análisis de spoofgrama.

Ninguna técnica aislada ofrece garantías suficientes. La fortaleza reside en la convergencia de evidencias.

La aparición de modelos de clonación de voz de código abierto marca un antes y un después en la investigación forense. La amenaza ya no reside únicamente en la calidad de las voces sintéticas, sino en la posibilidad de generarlas de forma completamente local, sin registros de actividad, sin proveedores intermediarios y con un nivel de sofisticación creciente.

Para los laboratorios especializados, el desafío consiste en evolucionar desde la simple detección de manipulaciones hacia metodologías integrales capaces de analizar autenticidad, procedencia, arquitectura de generación y posibles técnicas anti-forenses. En este nuevo escenario, la preservación de la evidencia digital, el análisis acústico avanzado y la interpretación pericial adquieren un papel decisivo.

La voz ya no puede considerarse, por sí sola, una prueba de identidad. La verdadera garantía reside en el análisis forense de audio que permita acreditar científicamente su autenticidad.

 

Graudio Forensics
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible.

La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.

Nunca almacenamos información personal.

Tienes toda la información sobre privacidad, derechos legales y cookies en nuestra página de Política de Cookies.