AI로 만든 음악인지 확인하는 방법
가장 믿을 만한 방법은 AI 음악 생성기의 신경 오디오 코덱이 남기는 잔여물을 찾는 포렌식 판별 모델을 쓰는 것입니다. 귀로 듣는 단서와 스펙트로그램은 빠르지만 최신 생성기일수록 틀리기 쉽습니다. ArtifactNet은 demo.intrect.io에서 계정 없이 무료로 판별합니다.
판별 결과는 사람의 검토를 돕는 증거이며 저작자를 증명하지 않습니다.
세 가지 방법 한눈에
| 방법 | 무엇을 보나 | 한계 |
|---|---|---|
| 귀로 듣기 | 지속음의 금속성 광택(주로 4–12kHz), 물결치는 떨림, 믹스 위에 떠 있는 보컬 | 생성기가 좋아질수록 귀를 속입니다 |
| 스펙트로그램 | 8–10kHz 위의 규칙적인 가로 줄무늬, 11–14kHz에서 갑자기 끊기는 대역 | 고해상도 도구와 해석 경험이 필요합니다 |
| 포렌식 판별 모델 | RVQ 코덱 양자화 오차의 물리적 구조 | 결과는 확률이므로 증거로 검토해야 합니다 |
방법 1. 귀로 듣는 단서
- 지속음의 금속성 광택: 오래 끄는 코드, 패드, 긴 음에 녹음된 악기에는 없는 미세한 반짝임이 얹힙니다. 전체 믹스에서는 4–12kHz에서 가장 잘 들립니다.
- 물결치는 떨림: 지속음의 음정과 음색이 빠르게 미세하게 흔들립니다. 코덱이 소리를 다시 이어 붙이는 과정의 위상 불일치로, 가벼운 코러스나 테이프 플러터처럼 들리지만 음악적인 효과가 아닙니다.
- 부자연스럽게 매끈한 전개: 구조는 맞지만 사람 연주의 물리적 추진력이 빠진 듯한 전환이 나옵니다.
- 믹스 위에 떠 있는 보컬: 공간 울림과 섞이지 않고, 위상이 지나치게 맞아 존재감보다 무균실 같은 느낌이 납니다.
- 너무 이른 다이내믹: 조용한 절과 큰 후렴의 대비가 과장되고 사람 편곡보다 조금 앞서 옵니다.
한계: Suno v4 이후 모델과 Udio 최신 모델은 가볍게 들어서는 귀를 속입니다. 업무나 법적 판단이 걸린 경우에는 포렌식 도구를 쓰세요.
방법 2. 스펙트로그램에서 볼 것
- 8–10kHz 위의 가로 줄무늬: 지속 구간에서 코덱 프레임 크기(대부분의 EnCodec 계열에서 약 23ms) 간격으로 반복됩니다.
- 노이즈 바닥의 규칙성: 실제 녹음의 고역 잡음은 무작위인데, AI 생성 음원은 같은 대역에 준주기적 구조가 보입니다.
- 딱 끊기는 대역 한계: 많은 생성기가 11–14kHz 위에서 급격히 떨어집니다. 44.1kHz로 녹음한 실제 음원은 20kHz까지 불규칙한 에너지가 이어집니다.
도구: iZotope RX, Sonic Visualiser(무료), Adobe Audition의 Spectral Frequency Display, 스펙트럼 분석 플러그인(예: Voxengo SPAN, 무료).
방법 3. 포렌식 판별 모델
| 도구 | F1 | 대상 생성기 | 이용 방법 |
|---|---|---|---|
| ArtifactNet (Intrect) | 0.9829 | 22종 (Suno, Udio, Stable Audio, MusicGen 포함) | 무료 데모, API(Pro) |
| SpecTTTra | 0.7713 | 8종 | 연구 논문 |
| CLAM | 0.7576 | 6종 | 연구 논문 |
출처: arXiv:2604.16254v2, Table V (ArtifactBench, v9.4 미공개 테스트). 같은 2,104곡으로 공개 판별기 8종을 다시 비교한 결과는 AI 음악 판별기 8종 비교에 따로 정리했습니다.
ArtifactNet은 특정 생성기의 스타일이 아니라 RVQ 양자화 오차의 수학적 구조를 찾습니다. 논문이 평가한 범위에서 학습에 없던 생성기의 음악도 판별했지만, 이는 논문이 시험한 생성기에서 측정한 결과이며 앞으로 나올 모든 생성기를 보장하지는 않습니다.
최종 검토 · 영문 원문을 옮긴 페이지입니다.
자주 묻는 질문
- 귀로 듣고 AI 음악을 구별할 수 있나요?
- 일부는 가능합니다. 지속음의 금속성 광택, 물결치는 떨림, 믹스 위에 뜬 보컬이 단서입니다. 다만 Suno v4 이후와 Udio 최신 모델은 가볍게 들어서는 귀를 속이므로, 업무나 법적 판단에는 포렌식 판별 도구를 쓰세요.
- 마스터링이나 EQ를 거치면 판별을 피할 수 있나요?
- 현재 기법으로는 아닙니다. RVQ 코덱 잔차는 일반적인 다이내믹 처리를 거쳐도 남는 스펙트럼 패턴이고, EQ는 잔차가 실리는 주파수를 옮길 뿐 양자화 구조를 없애지 못합니다. 스피커로 틀어 마이크로 다시 녹음하면 일부가 가려질 수 있지만, 논문의 시험 조건에서는 그 경우에도 통계적으로 유의한 판별 정확도가 유지됐습니다. 모든 녹음 환경을 보장하지는 않습니다.
- 사람이 만든 음악을 AI로 잘못 판정하기도 하나요?
- 그렇습니다. ArtifactBench(v9.4, 미공개 테스트)에서 실제 음악을 AI로 잘못 판정한 비율은 1.49%였습니다. 0이 아니므로 판정은 사람의 검토를 거치는 증거로 쓰세요.
- 무료로 판별해 볼 수 있나요?
- 네. demo.intrect.io에 WAV, MP3, FLAC 파일을 올리면 계정 없이 판정을 받을 수 있습니다. 무료 계정은 총 10분 분량의 오디오를 분석할 수 있고 카드가 필요 없습니다.