honenuki/ GUIDE
Inicio

Qué son los artefactos de la música IA y cómo Honenuki los mide y los elimina

Los artefactos de la música IA son el residuo que un generador deja en su salida: picos espectrales tenues pero regulares, espaciados a lo largo del eje de frecuencia, más un piso de siseo plano en los agudos. El EQ y la compresión pueden enmascararlos, pero no eliminarlos, porque los picos están dentro de las mismas bandas que la música. Para quitarlos hace falta un detector que localice la rejilla periódica y atenúe solo los picos que realmente están ahí, banda estrecha a banda estrecha. Eso es lo que hace Honenuki, y después devuelve textura y agudos con saturación, un de-esser y una banda de aire.

Última revisión 2026-09-02

Por qué Suno y otros generadores producen este sonido

Es arquitectónico, no un fallo de un modelo concreto. Los modelos generativos de audio construyen su salida mediante sobremuestreo: expanden repetidamente una representación interna compacta hasta llegar a la forma de onda, a través de capas de convolución transpuesta (deconvolución). Afchar y sus colegas demostraron matemáticamente que estas capas producen artefactos de frecuencia sistemáticos: picos espectrales pequeños pero característicos, el pariente sonoro del patrón de tablero de ajedrez conocido en los generadores de imagen. Su resultado clave es que el efecto se deriva de la arquitectura elegida y no de los datos de entrenamiento ni de los pesos, y por eso sobrevive a cualquier prompt, cualquier género y cualquier nueva tirada. Lo confirmaron en modelos de código abierto y en los generadores comerciales Suno y Udio, y mostraron que los picos por sí solos identifican música generada por IA con más del 99 % de acierto en varios escenarios. La misma pila de sobremuestreo está dentro de los códecs neuronales de audio con los que estos sistemas decodifican, construidos sobre cuantización vectorial residual en la línea de SoundStream. De ahí viene la otra mitad del sonido: un códec descarta lo que juzga inaudible y reconstruye el resto, dejando un piso de ruido plano y estático donde antes había detalle. Así aparecen dos cosas a la vez: una estructura periódica de picos que resuena y una cama de siseo por debajo. Ambas sobreviven a la exportación de stems y ambas siguen ahí después de una mezcla normal.

Mecanismo y criterio de detección: Afchar, Meseguer-Brocal, Akesbi, Hennequin (2025), “A Fourier Explanation of AI-music Artifacts”, arXiv:2506.19108. Contexto del códec: Zeghidour et al. (2021), “SoundStream: An End-to-End Neural Audio Codec”, arXiv:2107.03312.

Cómo funciona Honenuki

Cinco reglas gobiernan el motor. Vale la pena enunciarlas porque son lo que lo separa de un reductor de ruido.

Encuentra la rejilla antes de cortar

La detección busca picos que se repiten a un espaciado regular —unos 200 Hz en los modelos que vemos con más frecuencia— y un piso de ruido plano justo bajo el corte del códec. Donde no se encuentra rejilla, no se atenúa nada.

Corta estrecho, no ancho

La atenuación se aplica como muescas estrechas solo alrededor de los picos detectados. No hay ningún shelf de agudos de banda ancha. La atenuación está limitada a 8 dB en la banda de inteligibilidad y 15 dB en la banda alta, así que un error se queda pequeño.

Las máscaras se combinan por máximo, nunca en serie

Intensidad, de-ess e hiss producen cada una su máscara de atenuación. Se combinan tomando el máximo en cada punto, no multiplicando una tras otra. Multiplicar acumularía la atenuación hasta abrir agujeros; con el máximo gana la razón más profunda y nada se apila.

El residuo se calcula antes de añadir nada

El monitor REMOVED es una señal de diferencia real, capturada antes de volver a añadir saturación y aire. Es lo que se fue, no lo que cambió.

La batería se trata aparte

Los stems de batería usan un límite de atenuación de agudos más bajo y reducen la atenuación alrededor de los transitorios, de modo que ataques y platillos sobreviven a un ajuste que de otro modo los apagaría.

Qué hace cada mando

Seis controles. Tres quitan, dos devuelven y uno es solo para tus oídos.

Quitar

Intensidad (Strength)

Cuánto profundizan las muescas en los picos detectados. El valor mostrado por defecto es 40. Por debajo de un valor mostrado de aproximadamente 2, la profundidad de la muesca se desvanece a cero, así que el mando al mínimo significa realmente ningún procesado y no un poco de procesado. Subirlo profundiza los cortes, pero nunca los ensancha.

Por defecto 40 · límites 8 dB (banda de inteligibilidad) / 15 dB (banda alta)

De-esser

Un reductor de sibilancia para las eses duras. Es independiente de la eliminación de artefactos y funciona en cualquier stem, pero solo vale 0,3 por defecto en los stems detectados como voz, y 0 en el resto. No se aplica al máster, porque un de-esser sobre la mezcla completa daña todo lo que comparte esas frecuencias.

0,3 por defecto en stems de voz, 0 en el resto

Hiss

El supresor de siseo de agudos, que trabaja entre 6 y 14 kHz con una rampa coseno arriba para que nada cambie de golpe en el límite. Combina una puerta de ruido dinámica que abre y cierra según la relación señal-ruido con una muesca de peine permanente para los picos fijos. La puerta alcanza 40 dB de atenuación en el ajuste máximo; la muesca de peine está limitada a 20 dB.

6–14 kHz · puerta hasta −40 dB · muesca de peine hasta −20 dB · mando por defecto 0,1 = −4 dB

Devolver

Saturación

Generación de armónicos en tres bandas que devuelve densidad tras la eliminación. El valor es una cifra de distorsión objetivo (THD), no una ganancia, y el preset —WARM, PRESENT o AGGR— decide qué bandas se excitan y el equilibrio entre armónicos pares e impares. Por defecto es 0, así que no se añade nada salvo que lo pidas.

Por defecto 0 · el valor es THD objetivo % · presets WARM / PRESENT / AGGR

Aire (Air)

Un shelf de restauración para los agudos que la eliminación se lleva consigo. La lectura es el cambio neto respecto al original, así que 0 dB significa que has vuelto al punto de partida y por encima estás añadiendo brillo que la fuente no tenía. No resintetiza frecuencias que el códec descartó: levanta lo que queda.

−2 a +20 dB · por defecto +1,0 dB

Solo escucha

Ganancia (Gain)

Solo nivel de monitorización. Cambia lo que oyes al comparar y queda deliberadamente fuera del render, así que nada de lo que hagas aquí puede acabar en el archivo descargado.

−24 a +12 dB · nunca se aplica a la descarga

Lo que Honenuki no hace

Cifras

ElementoValor
Espaciado de rejilla detectadoaproximadamente 200 Hz
Banda de supresión de siseo6–14 kHz, rampa coseno arriba
Profundidad de la puerta de siseohasta −40 dB con el mando a 1,0 (por defecto 0,1 = −4 dB)
Límite de la muesca de peine−20 dB
Límites de las muescas8 dB banda de inteligibilidad, 15 dB banda alta
Intensidad por defecto (mostrada)40
Rango / defecto de Aire−2 a +20 dB / +1,0 dB
Combinación de máscarasmáximo, nunca multiplicación en serie
Residuocalculado antes de añadir saturación y aire
Formatos de entradaWAV, MP3, FLAC, AIFF
SalidaWAV (también MP3), en un único ZIP
Determinismomisma entrada y ajustes dan un archivo idéntico bit a bit
Escuchael navegador reproduce el mismo render del servidor que descargas

Preguntas

¿No puedo usar simplemente un EQ?

Para esto no. Los picos están dentro de las mismas bandas que la música, así que un corte de EQ lo bastante ancho como para atraparlos se lleva la música con él. Lo que funciona es una muesca estrecha colocada donde realmente hay un pico, y para eso hay que encontrar la rejilla primero.

¿Más intensidad suena siempre mejor?

No. La intensidad profundiza las muescas; pasado el punto en que los picos ya no están, empieza a comerse el material de alrededor. La prueba útil es el monitor REMOVED: si oyes melodía o palabras en él, el ajuste es demasiado alto.

¿Por qué el de-esser está a cero en los stems que no son voz?

Porque la sibilancia es un problema vocal, y aplicar de-esser a un stem de batería o sintetizador atenúa contenido que comparte esas frecuencias sin ningún beneficio. El mando sigue disponible en cualquier stem si lo quieres.

¿Por qué no hay mando de de-esser en el máster?

Un de-esser sobre la mezcla completa actúa sobre todas las fuentes que comparten esas frecuencias, no solo sobre la voz. El de-esser va en el stem de voz, y por eso aparece en la edición por stem y no en el máster.