Qué son los artefactos de la música IA y cómo Honenuki los mide y los elimina
Los artefactos de la música IA son el residuo que un generador deja en su salida: picos espectrales tenues pero regulares, espaciados a lo largo del eje de frecuencia, más un piso de siseo plano en los agudos. El EQ y la compresión pueden enmascararlos, pero no eliminarlos, porque los picos están dentro de las mismas bandas que la música. Para quitarlos hace falta un detector que localice la rejilla periódica y atenúe solo los picos que realmente están ahí, banda estrecha a banda estrecha. Eso es lo que hace Honenuki, y después devuelve textura y agudos con saturación, un de-esser y una banda de aire.
Última revisión 2026-09-02
Por qué Suno y otros generadores producen este sonido
Es arquitectónico, no un fallo de un modelo concreto. Los modelos generativos de audio construyen su salida mediante sobremuestreo: expanden repetidamente una representación interna compacta hasta llegar a la forma de onda, a través de capas de convolución transpuesta (deconvolución). Afchar y sus colegas demostraron matemáticamente que estas capas producen artefactos de frecuencia sistemáticos: picos espectrales pequeños pero característicos, el pariente sonoro del patrón de tablero de ajedrez conocido en los generadores de imagen. Su resultado clave es que el efecto se deriva de la arquitectura elegida y no de los datos de entrenamiento ni de los pesos, y por eso sobrevive a cualquier prompt, cualquier género y cualquier nueva tirada. Lo confirmaron en modelos de código abierto y en los generadores comerciales Suno y Udio, y mostraron que los picos por sí solos identifican música generada por IA con más del 99 % de acierto en varios escenarios. La misma pila de sobremuestreo está dentro de los códecs neuronales de audio con los que estos sistemas decodifican, construidos sobre cuantización vectorial residual en la línea de SoundStream. De ahí viene la otra mitad del sonido: un códec descarta lo que juzga inaudible y reconstruye el resto, dejando un piso de ruido plano y estático donde antes había detalle. Así aparecen dos cosas a la vez: una estructura periódica de picos que resuena y una cama de siseo por debajo. Ambas sobreviven a la exportación de stems y ambas siguen ahí después de una mezcla normal.
Mecanismo y criterio de detección: Afchar, Meseguer-Brocal, Akesbi, Hennequin (2025), “A Fourier Explanation of AI-music Artifacts”, arXiv:2506.19108. Contexto del códec: Zeghidour et al. (2021), “SoundStream: An End-to-End Neural Audio Codec”, arXiv:2107.03312.
Cómo funciona Honenuki
Cinco reglas gobiernan el motor. Vale la pena enunciarlas porque son lo que lo separa de un reductor de ruido.
Encuentra la rejilla antes de cortar
La detección busca picos que se repiten a un espaciado regular —unos 200 Hz en los modelos que vemos con más frecuencia— y un piso de ruido plano justo bajo el corte del códec. Donde no se encuentra rejilla, no se atenúa nada.
Corta estrecho, no ancho
La atenuación se aplica como muescas estrechas solo alrededor de los picos detectados. No hay ningún shelf de agudos de banda ancha. La atenuación está limitada a 8 dB en la banda de inteligibilidad y 15 dB en la banda alta, así que un error se queda pequeño.
Las máscaras se combinan por máximo, nunca en serie
Intensidad, de-ess e hiss producen cada una su máscara de atenuación. Se combinan tomando el máximo en cada punto, no multiplicando una tras otra. Multiplicar acumularía la atenuación hasta abrir agujeros; con el máximo gana la razón más profunda y nada se apila.
El residuo se calcula antes de añadir nada
El monitor REMOVED es una señal de diferencia real, capturada antes de volver a añadir saturación y aire. Es lo que se fue, no lo que cambió.
La batería se trata aparte
Los stems de batería usan un límite de atenuación de agudos más bajo y reducen la atenuación alrededor de los transitorios, de modo que ataques y platillos sobreviven a un ajuste que de otro modo los apagaría.
Qué hace cada mando
Seis controles. Tres quitan, dos devuelven y uno es solo para tus oídos.
Quitar
Intensidad (Strength)
Cuánto profundizan las muescas en los picos detectados. El valor mostrado por defecto es 40. Por debajo de un valor mostrado de aproximadamente 2, la profundidad de la muesca se desvanece a cero, así que el mando al mínimo significa realmente ningún procesado y no un poco de procesado. Subirlo profundiza los cortes, pero nunca los ensancha.
Por defecto 40 · límites 8 dB (banda de inteligibilidad) / 15 dB (banda alta)De-esser
Un reductor de sibilancia para las eses duras. Es independiente de la eliminación de artefactos y funciona en cualquier stem, pero solo vale 0,3 por defecto en los stems detectados como voz, y 0 en el resto. No se aplica al máster, porque un de-esser sobre la mezcla completa daña todo lo que comparte esas frecuencias.
0,3 por defecto en stems de voz, 0 en el restoHiss
El supresor de siseo de agudos, que trabaja entre 6 y 14 kHz con una rampa coseno arriba para que nada cambie de golpe en el límite. Combina una puerta de ruido dinámica que abre y cierra según la relación señal-ruido con una muesca de peine permanente para los picos fijos. La puerta alcanza 40 dB de atenuación en el ajuste máximo; la muesca de peine está limitada a 20 dB.
6–14 kHz · puerta hasta −40 dB · muesca de peine hasta −20 dB · mando por defecto 0,1 = −4 dBDevolver
Saturación
Generación de armónicos en tres bandas que devuelve densidad tras la eliminación. El valor es una cifra de distorsión objetivo (THD), no una ganancia, y el preset —WARM, PRESENT o AGGR— decide qué bandas se excitan y el equilibrio entre armónicos pares e impares. Por defecto es 0, así que no se añade nada salvo que lo pidas.
Por defecto 0 · el valor es THD objetivo % · presets WARM / PRESENT / AGGRAire (Air)
Un shelf de restauración para los agudos que la eliminación se lleva consigo. La lectura es el cambio neto respecto al original, así que 0 dB significa que has vuelto al punto de partida y por encima estás añadiendo brillo que la fuente no tenía. No resintetiza frecuencias que el códec descartó: levanta lo que queda.
−2 a +20 dB · por defecto +1,0 dBSolo escucha
Ganancia (Gain)
Solo nivel de monitorización. Cambia lo que oyes al comparar y queda deliberadamente fuera del render, así que nada de lo que hagas aquí puede acabar en el archivo descargado.
−24 a +12 dB · nunca se aplica a la descargaLo que Honenuki no hace
- No es un separador de stems. Limpia el archivo que subes, sea una mezcla completa o un stem que ya tienes. No dividirá una canción en voz, batería y bajo.
- No es un quitador de marcas de agua. No toca marcas inaudibles como SynthID o credenciales C2PA, y no promete nada sobre los filtros de IA de distribuidoras o plataformas de streaming.
- No es una cadena de masterización. No hay limitación ni normalización de sonoridad. Limpia primero y masteriza después.
- No es un extensor de ancho de banda. No inventa frecuencias que el códec tiró.
- No es prueba forense. El veredicto de IA informa sobre huellas de códec. Nunca bloquea el procesado, y un stem juzgado humano se trata exactamente como pidas.
Cifras
| Elemento | Valor |
|---|---|
| Espaciado de rejilla detectado | aproximadamente 200 Hz |
| Banda de supresión de siseo | 6–14 kHz, rampa coseno arriba |
| Profundidad de la puerta de siseo | hasta −40 dB con el mando a 1,0 (por defecto 0,1 = −4 dB) |
| Límite de la muesca de peine | −20 dB |
| Límites de las muescas | 8 dB banda de inteligibilidad, 15 dB banda alta |
| Intensidad por defecto (mostrada) | 40 |
| Rango / defecto de Aire | −2 a +20 dB / +1,0 dB |
| Combinación de máscaras | máximo, nunca multiplicación en serie |
| Residuo | calculado antes de añadir saturación y aire |
| Formatos de entrada | WAV, MP3, FLAC, AIFF |
| Salida | WAV (también MP3), en un único ZIP |
| Determinismo | misma entrada y ajustes dan un archivo idéntico bit a bit |
| Escucha | el navegador reproduce el mismo render del servidor que descargas |
Preguntas
¿No puedo usar simplemente un EQ?
Para esto no. Los picos están dentro de las mismas bandas que la música, así que un corte de EQ lo bastante ancho como para atraparlos se lleva la música con él. Lo que funciona es una muesca estrecha colocada donde realmente hay un pico, y para eso hay que encontrar la rejilla primero.
¿Más intensidad suena siempre mejor?
No. La intensidad profundiza las muescas; pasado el punto en que los picos ya no están, empieza a comerse el material de alrededor. La prueba útil es el monitor REMOVED: si oyes melodía o palabras en él, el ajuste es demasiado alto.
¿Por qué el de-esser está a cero en los stems que no son voz?
Porque la sibilancia es un problema vocal, y aplicar de-esser a un stem de batería o sintetizador atenúa contenido que comparte esas frecuencias sin ningún beneficio. El mando sigue disponible en cualquier stem si lo quieres.
¿Por qué no hay mando de de-esser en el máster?
Un de-esser sobre la mezcla completa actúa sobre todas las fuentes que comparten esas frecuencias, no solo sobre la voz. El de-esser va en el stem de voz, y por eso aparece en la edición por stem y no en el máster.