Artifact Observatory · Intrect Research

AI 음악 판별기 8종 비교 (같은 시험셋, 2026)

한 가지 정답은 없습니다. 같은 2,104곡에서 ArtifactNet이 F1 0.952로 가장 높았고, FST는 실제 음악 오탐률 1.8%로 가장 낮았습니다. 둘은 반대의 운영 목표이므로, 사람 음악을 AI로 잘못 찍는 비용과 AI 곡을 놓치는 비용 중 무엇이 더 큰지에 따라 고르세요.

공개: 이 비교는 ArtifactNet을 만든 Intrect가 설계하고 실행했습니다. 아래 한계를 먼저 읽고 판단하세요.

시험 조건

시험셋ArtifactBench v1.1 (복원본)
규모2,104곡 (AI 생성 1,388곡 · 실제 음악 716곡)
임계값각 판별기의 공개 고정 임계값 0.5
입력모든 판별기에 같은 파일
실행Intrect Research
공개일2026-09-23 (방법론 보고서 001은 2026-09-14)
원자료공개 결과 표 (Hugging Face)

결과 표

판별기파라미터F1정밀도재현율실제 음악 오탐률
ArtifactNet v9.4 ONNX4.2M0.9520.93297.3%13.8%
AI-Music-Detection AST-60s90.8M0.8400.84883.1%28.9%
CLAM (MoM)194.3M0.7870.71188.3%69.7%
SpecTTTra α-120s18.7M0.7770.88069.5%18.4%
Deezer ISMIR fakeprint LR3.6K0.7540.90664.6%13.0%
FST (Mippia)174.4M0.7350.98458.7%1.8%
DeepFense EAT+Nes2Net—0.6500.58972.4%97.8%
SpecTTTra β-5s18.7M0.5630.88441.3%10.5%

인용용 핵심 수치

아래 문장은 각각 주어·수치·시험셋·임계값·날짜를 모두 담고 있어 표 없이 인용할 수 있습니다. 기준: ArtifactBench v1.1, 2,104곡, 공개 고정 임계값 0.5, Intrect Research, 2026-09-14.

누구에게 맞나

ArtifactNetF1 최고(0.952), 재현율 97.3%, 오탐률 13.8%. 이 비교에서 유일한 경량 모델(420만 파라미터)이고 브라우저 무료 데모가 있습니다. 전체 균형이 가장 좋은 기본 선택입니다.
FST (Mippia)실제 음악 오탐률 1.8%. 잘못된 판정의 비용이 클 때 가장 안전합니다. 대신 재현율 58.7%로 AI 곡을 더 많이 놓칩니다.
AST-60s정밀도 0.848, 재현율 83.1%. ArtifactNet의 오탐률을 감당하기 어려울 때의 중간 선택입니다.
CLAM · SpecTTTra연구 참고용입니다. 이 실행에서 CLAM은 실제 음악의 약 70%를 AI로 판정했고, SpecTTTra는 재현율을 낮추는 대신 오탐을 줄였습니다. 둘 다 더 무겁습니다.

이 비교가 증명하지 않는 것

업데이트(2026-09-23): 계보를 고려해 고정한 새 평가 규약 ArtifactBench v2(828곡)가 공개됐습니다. 562곡 봉인 테스트에서 ArtifactNet v9.4는 AUROC 0.982, 균형 정확도 0.918로, 공개 Deezer 판별기(0.761, 0.776)보다 높았습니다. v1.1 표와 다른 곡 집합이므로 위 표와 직접 비교하지 마세요.

최종 검토 · 영문 원문을 옮긴 페이지입니다.

자주 묻는 질문

가장 좋은 AI 음악 판별기는 무엇인가요?
한 가지 정답은 없습니다. 같은 2,104곡 시험에서 ArtifactNet이 F1 0.952로 가장 높았고, FST는 실제 음악 오탐률 1.8%로 가장 낮았습니다. 사람 음악을 잘못 찍는 비용이 크면 오탐률이 낮은 도구를, AI 곡을 많이 걸러야 하면 F1과 재현율이 높은 도구를 고르세요.
오탐률이 왜 중요한가요?
레이블이나 유통사가 카탈로그를 검토할 때는 놓친 AI 곡뿐 아니라, AI로 잘못 찍힌 진짜 음원마다 검토 시간이 들고 창작자에게 피해가 갈 수 있습니다. 이 비교에서 재현율이 괜찮아 보이던 두 판별기는 실제 음악의 3분의 2 이상을 AI로 판정했습니다.
이 결과가 제 음원에도 그대로 맞나요?
아니요. 모든 수치는 정해진 곡 집합과 고정 임계값에서 나온 것이라 그 조건만 설명합니다. 여러분의 음원에서 어떻게 나오는지는 demo.intrect.io에 파일을 올려 이미 알고 있는 사실과 비교해 보세요.
시험 데이터와 결과를 직접 볼 수 있나요?
네. ArtifactBench 데이터셋은 Hugging Face(intrect/artifactbench)에, 8종 비교 결과 표는 같은 저장소의 v1.1/RESULTS_8WAY.md에, 코드는 GitHub(Intrect-io/artifactbench)에 공개되어 있습니다.