Files
live-app-translator/tests/test_segmenter.py
EJClaw e234ad4401 fix: webrtcvad 가 깔린 환경에서만 분할기 테스트 5개가 깨지던 원인 제거
Windows CI 에서 test_segmenter.py 5개가 실패하고 로컬에서는 통과했다.
플랫폼 차이가 아니라 선택 의존성 차이였다.

테스트 입력은 220Hz 순음이다. `_is_speech` 는 에너지 판정과 webrtcvad 를
AND 로 묶는데, webrtcvad 는 사람 목소리로 학습돼 있어 순음을 발화로 보지
않는다. 포터블 exe 의 requirements 에 webrtcvad-wheels 가 들어 있으니
Windows CI 는 게이트가 켜진 환경이고, 개발 venv 에는 없어서 안 드러났다.
(개발 venv 에 webrtcvad-wheels 를 넣으면 리눅스에서도 5개가 똑같이,
같은 수치로 깨지는 것을 확인했다.)

- 이 파일이 검증하려는 건 분할 상태 기계이므로 autouse fixture 로
  선택 의존성을 끊어 환경과 무관하게 같은 경로를 시험한다
- 게이트 동작 자체는 test_webrtcvad_gate_filters_pure_tone 이 따로 본다
  (webrtcvad 없으면 skip)
- dev extras 에 webrtcvad-wheels 를 넣어 같은 환경 드리프트가 재발하지
  않게 한다
2026-09-25 23:38:17 +09:00

122 lines
4.7 KiB
Python

import numpy as np
import pytest
from livesub.audio import segmenter as segmenter_mod
from livesub.audio.segmenter import Segmenter, SegmenterConfig
from livesub.constants import SAMPLE_RATE
#: webrtcvad 는 선택 의존성이다. 있으면 아래 게이트 테스트가 돌고 없으면 skip 된다.
REAL_WEBRTCVAD = segmenter_mod.webrtcvad
@pytest.fixture(autouse=True)
def _energy_vad_only(monkeypatch):
"""이 파일의 테스트는 에너지 VAD 경로로 고정한다.
입력이 220Hz 순음이기 때문이다. webrtcvad 는 사람 목소리로 학습돼 있어
순음을 발화로 보지 않고, `_is_speech` 는 에너지 판정과 webrtcvad 를 AND 로
묶는다. 그래서 webrtcvad 가 깔린 환경에서는 이 파일의 테스트 5개가 깨졌다 —
포터블 exe 의 requirements 에 webrtcvad-wheels 가 들어 있어 Windows CI 가
정확히 그 환경이고, 개발용 venv 에는 없어서 여태 안 드러났다.
고칠 대상은 판정기가 아니라 테스트의 숨은 전제다. 여기서 보려는 건 분할
상태 기계이므로 선택 의존성을 끊어 환경과 무관하게 같은 경로를 시험한다.
게이트 동작 자체는 test_webrtcvad_gate_filters_pure_tone 이 본다.
"""
monkeypatch.setattr(segmenter_mod, "webrtcvad", None)
def tone(ms: int, amplitude: float = 0.3) -> np.ndarray:
n = SAMPLE_RATE * ms // 1000
t = np.arange(n, dtype=np.float32) / SAMPLE_RATE
return (np.sin(2 * np.pi * 220 * t) * amplitude).astype(np.float32)
def silence(ms: int) -> np.ndarray:
return np.zeros(SAMPLE_RATE * ms // 1000, dtype=np.float32)
def config(**kw) -> SegmenterConfig:
base = dict(silence_ms=300, min_segment_ms=200, max_segment_ms=5000,
partial_interval_ms=0)
base.update(kw)
return SegmenterConfig(**base)
def test_speech_then_silence_emits_one_final_segment():
seg = Segmenter(config())
out = seg.push(silence(200))
assert out == []
out += seg.push(tone(800))
out += seg.push(silence(600))
finals = [s for s in out if s.is_final]
assert len(finals) == 1
assert 0.7 <= finals[0].duration_s <= 1.8
def test_short_blip_is_discarded():
seg = Segmenter(config(min_segment_ms=500))
out = seg.push(tone(60)) + seg.push(silence(600))
assert out == []
def test_max_length_forces_a_cut():
seg = Segmenter(config(max_segment_ms=1000))
out = seg.push(tone(3000))
assert len([s for s in out if s.is_final]) >= 2
def test_partial_results_are_emitted_while_speaking():
seg = Segmenter(config(partial_interval_ms=300))
out = seg.push(tone(1500))
partials = [s for s in out if not s.is_final]
assert len(partials) >= 2
# 중간 결과는 누적된다
assert partials[-1].duration_s > partials[0].duration_s
def test_flush_returns_pending_speech():
seg = Segmenter(config())
assert seg.push(tone(700)) == [] # 아직 침묵이 안 왔으니 확정 없음
leftover = seg.flush()
assert leftover is not None and leftover.is_final
assert seg.flush() is None
def test_continuous_silence_never_emits():
seg = Segmenter(config())
for _ in range(10):
assert seg.push(silence(200)) == []
def test_lead_in_is_prepended():
"""발화 직전 오디오가 붙어 첫 음절이 잘리지 않아야 한다."""
seg = Segmenter(config(lead_in_ms=200))
seg.push(silence(400))
out = seg.push(tone(600)) + seg.push(silence(600))
finals = [s for s in out if s.is_final]
assert len(finals) == 1
# 0.6초 발화 + 최대 0.2초 리드인
assert finals[0].duration_s > 0.6
@pytest.mark.skipif(REAL_WEBRTCVAD is None, reason="webrtcvad 미설치 — 게이트 경로가 없다")
def test_webrtcvad_gate_filters_pure_tone(monkeypatch):
"""webrtcvad 가 깔리면 순음은 에너지 VAD 만일 때보다 덜 통과한다.
포터블 exe 와 Windows CI 가 이 경로를 쓴다. 두 경로가 실제로 다르게
동작한다는 사실을 테스트로 고정해 둔다 — 이게 깨져 있는 걸 몰라서
같은 테스트가 플랫폼에 따라 다른 결과를 냈다.
"""
energy_only = Segmenter(config())
energy_out = energy_only.push(tone(800)) + energy_only.push(silence(600))
monkeypatch.setattr(segmenter_mod, "webrtcvad", REAL_WEBRTCVAD)
gated = Segmenter(config())
gated_out = gated.push(tone(800)) + gated.push(silence(600))
energy_total = sum(s.duration_s for s in energy_out if s.is_final)
gated_total = sum(s.duration_s for s in gated_out if s.is_final)
assert energy_total > 0.7 # 에너지 VAD 는 순음을 발화로 본다
assert gated_total < energy_total # webrtcvad 는 사람 목소리가 아니라고 걸러낸다