콘텐츠로 이동

벤치마크 방법론

리더보드의 모든 숫자가 정확히 어떻게 만들어지는지 — 암묵적으로 두면 결과를 왜곡할 수 있는 정책까지 — 명시한다.

프로토콜

  • 분할: 데이터셋별 공식 train/test 분할. train은 정상 위주로 가정한다 (비지도 설정). 전처리에 test 통계가 새지 않는다 — z-score 정규화는 train 평균/표준편차만 사용한다.
  • 시드: 결정적 모델은 1회, 확률적(딥러닝) 모델은 시드 3개로 실행하고 모든 실행을 개별 저장한다 (시드 평균은 집계 시점에만 계산).
  • 임계값은 모델과 분리: 연속 점수는 모델이, 결정은 thresholding 모듈이 담당한다 (기본 quantile; SPOT/DSPOT, conformal 제공). threshold-free 지표 (주지표 VUS-PR)를 항상 병행 보고한다.
  • 스코어 원본 저장 (benchmarks/results/scores/*.npz) — 모델 재실행 없이 모든 지표를 재계산할 수 있다.

하이퍼파라미터 정책

모든 모델은 논문/라이브러리 기본값으로 실행하며, 어떤 모델도 데이터셋별 튜닝을 하지 않는다. 이는 의도된 공정성 선택이다: 튜닝 예산은 선행 TSAD 비교들에서 순위를 뒤집어온 숨은 변수다 (TSB-AD의 HP 민감도 논의 참조). 따라서 여기의 모든 숫자는 기본 설정 결과다 — 튜닝된 배포는 더 좋을 수 있고, 유사 데이터에서 기본값이 정해진 모델은 태생적으로 유리하다. validation 분할 기반 HP 선택 프로토콜은 로드맵에 있다.

측정

  • runtime_fit_s / runtime_score_s: fit()/score()만 감싼 wall-clock. 계측 구간 안에 프로파일러 없음. runtime_s = fit + score. 임계값 보정 비용은 제외.
  • peak_mem_mb: 구간 시작 대비 프로세스 RSS 피크 증가분 (백그라운드 스레드가 20ms 간격 샘플링). 간격보다 짧은 스파이크는 놓칠 수 있다 — 런타임 무오염과 맞바꾼 트레이드오프.
  • peak_vram_mb: 모델이 실제로 CUDA에서 실행된 경우에만 torch.cuda.max_memory_allocated로 JSON 요약에 기록. CPU 실행에는 VRAM 값이 없다 — 과거 버전은 호스트 메모리를 이 이름으로 잘못 기록했고, 해당 컬럼은 제거됐다.

집계 규칙

  • 집계 단위는 엔티티(데이터셋의 채널/머신/시리즈). 리더보드 평균은 시드 평균의 엔티티 평균이다.
  • 모든 평균에 엔티티 bootstrap 95% CI와 커버 엔티티 수를 병기한다. 엔티티가 적고 CI가 넓은 평균은 약한 근거다.
  • 완전 커버리지 엔티티 집합에 대한 Friedman 검정이 순위 주장의 관문이다: 기각되지 않으면 인접 순위는 동률로 읽어야 한다. 어느 쌍이 구분되는지는 critical-difference 다이어그램이 보여준다.
  • 결과는 실험 정체성 (model, dataset, channel, seed, data-hash) 기준으로 중복 제거된다: 기본 config 변경으로 재실행되면 최신 결과만 집계된다 — 구결과가 이중 집계될 수 없다.
  • 데이터 부재(신청 필요 데이터셋, 차단된 미러)는 no_data로 보고하며 조용히 누락시키지 않는다.

온라인 트랙 (experimental)

online_* 모델은 prequential이다: 각 시점을 과거 정보만으로 채점한 뒤 상태를 갱신한다 — test 전체를 본 뒤 채점하는 배치 모델과 다르다. 같은 표에 나타나지만 이 비대칭은 배치 모델에 유리하다; 온라인 행은 더 어려운 설정으로 읽어야 한다. 임계값 기반 실행에는 mean_detection_delay(이벤트 시작 → 첫 경보까지 steps; 미탐 이벤트는 이벤트 길이 전체를 부과)를 보고한다.

알려진 한계

  • lite 프로파일은 preview 부분집합이다 — 데이터셋당 소수 엔티티를 CI 속도 기준으로 골랐고 대표성 기준이 아니다. full 매트릭스 결과로 대체된다.
  • PA-F1은 --legacy-pa 뒤에서만, 경고와 함께 계산된다: point adjustment는 random score도 SOTA처럼 보이게 만들 만큼 점수를 부풀린다 (Kim et al., AAAI 2022).
  • PA 기반 선행 논문의 수치는 여기의 어떤 수치와도 비교 불가하다.