AI 음악 판별기 8종 비교 (같은 시험셋, 2026)
한 가지 정답은 없습니다. 같은 2,104곡에서 ArtifactNet이 F1 0.952로 가장 높았고, FST는 실제 음악 오탐률 1.8%로 가장 낮았습니다. 둘은 반대의 운영 목표이므로, 사람 음악을 AI로 잘못 찍는 비용과 AI 곡을 놓치는 비용 중 무엇이 더 큰지에 따라 고르세요.
공개: 이 비교는 ArtifactNet을 만든 Intrect가 설계하고 실행했습니다. 아래 한계를 먼저 읽고 판단하세요.
시험 조건
| 시험셋 | ArtifactBench v1.1 (복원본) |
|---|---|
| 규모 | 2,104곡 (AI 생성 1,388곡 · 실제 음악 716곡) |
| 임계값 | 각 판별기의 공개 고정 임계값 0.5 |
| 입력 | 모든 판별기에 같은 파일 |
| 실행 | Intrect Research |
| 공개일 | 2026-09-23 (방법론 보고서 001은 2026-09-14) |
| 원자료 | 공개 결과 표 (Hugging Face) |
결과 표
| 판별기 | 파라미터 | F1 | 정밀도 | 재현율 | 실제 음악 오탐률 |
|---|---|---|---|---|---|
| ArtifactNet v9.4 ONNX | 4.2M | 0.952 | 0.932 | 97.3% | 13.8% |
| AI-Music-Detection AST-60s | 90.8M | 0.840 | 0.848 | 83.1% | 28.9% |
| CLAM (MoM) | 194.3M | 0.787 | 0.711 | 88.3% | 69.7% |
| SpecTTTra α-120s | 18.7M | 0.777 | 0.880 | 69.5% | 18.4% |
| Deezer ISMIR fakeprint LR | 3.6K | 0.754 | 0.906 | 64.6% | 13.0% |
| FST (Mippia) | 174.4M | 0.735 | 0.984 | 58.7% | 1.8% |
| DeepFense EAT+Nes2Net | — | 0.650 | 0.589 | 72.4% | 97.8% |
| SpecTTTra β-5s | 18.7M | 0.563 | 0.884 | 41.3% | 10.5% |
인용용 핵심 수치
아래 문장은 각각 주어·수치·시험셋·임계값·날짜를 모두 담고 있어 표 없이 인용할 수 있습니다. 기준: ArtifactBench v1.1, 2,104곡, 공개 고정 임계값 0.5, Intrect Research, 2026-09-14.
- ArtifactNet v9.4(파라미터 420만 개)는 8종 가운데 가장 높은 F1 0.952를 기록했고, AI 곡 재현율은 97.3%, 실제 음악 오탐률은 13.8%였습니다.
- FST(Mippia, 파라미터 1억 7,440만 개)는 실제 음악 오탐률이 1.8%로 가장 낮았지만, 재현율은 58.7%(F1 0.735)에 그쳤습니다.
- 두 판별기는 실제 음악의 3분의 2 이상을 AI로 판정했습니다. CLAM(MoM) 69.7%, DeepFense EAT+Nes2Net 97.8%입니다.
- 파라미터 수는 순위를 예측하지 못했습니다. 파라미터 3,600개의 Deezer fakeprint 모델(F1 0.754)이 1억 7천만 개가 넘는 모델 두 개보다 높았습니다.
누구에게 맞나
| ArtifactNet | F1 최고(0.952), 재현율 97.3%, 오탐률 13.8%. 이 비교에서 유일한 경량 모델(420만 파라미터)이고 브라우저 무료 데모가 있습니다. 전체 균형이 가장 좋은 기본 선택입니다. |
|---|---|
| FST (Mippia) | 실제 음악 오탐률 1.8%. 잘못된 판정의 비용이 클 때 가장 안전합니다. 대신 재현율 58.7%로 AI 곡을 더 많이 놓칩니다. |
| AST-60s | 정밀도 0.848, 재현율 83.1%. ArtifactNet의 오탐률을 감당하기 어려울 때의 중간 선택입니다. |
| CLAM · SpecTTTra | 연구 참고용입니다. 이 실행에서 CLAM은 실제 음악의 약 70%를 AI로 판정했고, SpecTTTra는 재현율을 낮추는 대신 오탐을 줄였습니다. 둘 다 더 무겁습니다. |
이 비교가 증명하지 않는 것
- 복원된 실제 음악은 정리된 목록의 모든 행이 아니라 구할 수 있었던 716곡입니다.
- 고정 임계값은 재현 가능하지만, 여러분의 카탈로그와 허용 오차에 가장 좋은 값은 아닐 수 있습니다.
- 생성기와 코덱은 바뀝니다. 오늘의 Suno·Udio에 맞춘 판별기가 새 모델에서는 뒤처질 수 있습니다.
- 판별은 출처 증명이 아닙니다. 어떤 점수도 Content Credentials, 플랫폼 메타데이터, 사람의 검토·이의 절차를 대신하지 못합니다.
업데이트(2026-09-23): 계보를 고려해 고정한 새 평가 규약 ArtifactBench v2(828곡)가 공개됐습니다. 562곡 봉인 테스트에서 ArtifactNet v9.4는 AUROC 0.982, 균형 정확도 0.918로, 공개 Deezer 판별기(0.761, 0.776)보다 높았습니다. v1.1 표와 다른 곡 집합이므로 위 표와 직접 비교하지 마세요.
최종 검토 · 영문 원문을 옮긴 페이지입니다.
자주 묻는 질문
- 가장 좋은 AI 음악 판별기는 무엇인가요?
- 한 가지 정답은 없습니다. 같은 2,104곡 시험에서 ArtifactNet이 F1 0.952로 가장 높았고, FST는 실제 음악 오탐률 1.8%로 가장 낮았습니다. 사람 음악을 잘못 찍는 비용이 크면 오탐률이 낮은 도구를, AI 곡을 많이 걸러야 하면 F1과 재현율이 높은 도구를 고르세요.
- 오탐률이 왜 중요한가요?
- 레이블이나 유통사가 카탈로그를 검토할 때는 놓친 AI 곡뿐 아니라, AI로 잘못 찍힌 진짜 음원마다 검토 시간이 들고 창작자에게 피해가 갈 수 있습니다. 이 비교에서 재현율이 괜찮아 보이던 두 판별기는 실제 음악의 3분의 2 이상을 AI로 판정했습니다.
- 이 결과가 제 음원에도 그대로 맞나요?
- 아니요. 모든 수치는 정해진 곡 집합과 고정 임계값에서 나온 것이라 그 조건만 설명합니다. 여러분의 음원에서 어떻게 나오는지는 demo.intrect.io에 파일을 올려 이미 알고 있는 사실과 비교해 보세요.
- 시험 데이터와 결과를 직접 볼 수 있나요?
- 네. ArtifactBench 데이터셋은 Hugging Face(intrect/artifactbench)에, 8종 비교 결과 표는 같은 저장소의 v1.1/RESULTS_8WAY.md에, 코드는 GitHub(Intrect-io/artifactbench)에 공개되어 있습니다.