import numpy as np import pytest from livesub.audio import segmenter as segmenter_mod from livesub.audio.segmenter import Segmenter, SegmenterConfig from livesub.constants import SAMPLE_RATE #: webrtcvad 는 선택 의존성이다. 있으면 아래 게이트 테스트가 돌고 없으면 skip 된다. REAL_WEBRTCVAD = segmenter_mod.webrtcvad @pytest.fixture(autouse=True) def _energy_vad_only(monkeypatch): """이 파일의 테스트는 에너지 VAD 경로로 고정한다. 입력이 220Hz 순음이기 때문이다. webrtcvad 는 사람 목소리로 학습돼 있어 순음을 발화로 보지 않고, `_is_speech` 는 에너지 판정과 webrtcvad 를 AND 로 묶는다. 그래서 webrtcvad 가 깔린 환경에서는 이 파일의 테스트 5개가 깨졌다 — 포터블 exe 의 requirements 에 webrtcvad-wheels 가 들어 있어 Windows CI 가 정확히 그 환경이고, 개발용 venv 에는 없어서 여태 안 드러났다. 고칠 대상은 판정기가 아니라 테스트의 숨은 전제다. 여기서 보려는 건 분할 상태 기계이므로 선택 의존성을 끊어 환경과 무관하게 같은 경로를 시험한다. 게이트 동작 자체는 test_webrtcvad_gate_filters_pure_tone 이 본다. """ monkeypatch.setattr(segmenter_mod, "webrtcvad", None) def tone(ms: int, amplitude: float = 0.3) -> np.ndarray: n = SAMPLE_RATE * ms // 1000 t = np.arange(n, dtype=np.float32) / SAMPLE_RATE return (np.sin(2 * np.pi * 220 * t) * amplitude).astype(np.float32) def silence(ms: int) -> np.ndarray: return np.zeros(SAMPLE_RATE * ms // 1000, dtype=np.float32) def config(**kw) -> SegmenterConfig: base = dict(silence_ms=300, min_segment_ms=200, max_segment_ms=5000, partial_interval_ms=0) base.update(kw) return SegmenterConfig(**base) def test_speech_then_silence_emits_one_final_segment(): seg = Segmenter(config()) out = seg.push(silence(200)) assert out == [] out += seg.push(tone(800)) out += seg.push(silence(600)) finals = [s for s in out if s.is_final] assert len(finals) == 1 assert 0.7 <= finals[0].duration_s <= 1.8 def test_short_blip_is_discarded(): seg = Segmenter(config(min_segment_ms=500)) out = seg.push(tone(60)) + seg.push(silence(600)) assert out == [] def test_max_length_forces_a_cut(): seg = Segmenter(config(max_segment_ms=1000)) out = seg.push(tone(3000)) assert len([s for s in out if s.is_final]) >= 2 def test_partial_results_are_emitted_while_speaking(): seg = Segmenter(config(partial_interval_ms=300)) out = seg.push(tone(1500)) partials = [s for s in out if not s.is_final] assert len(partials) >= 2 # 중간 결과는 누적된다 assert partials[-1].duration_s > partials[0].duration_s def test_flush_returns_pending_speech(): seg = Segmenter(config()) assert seg.push(tone(700)) == [] # 아직 침묵이 안 왔으니 확정 없음 leftover = seg.flush() assert leftover is not None and leftover.is_final assert seg.flush() is None def test_continuous_silence_never_emits(): seg = Segmenter(config()) for _ in range(10): assert seg.push(silence(200)) == [] def test_lead_in_is_prepended(): """발화 직전 오디오가 붙어 첫 음절이 잘리지 않아야 한다.""" seg = Segmenter(config(lead_in_ms=200)) seg.push(silence(400)) out = seg.push(tone(600)) + seg.push(silence(600)) finals = [s for s in out if s.is_final] assert len(finals) == 1 # 0.6초 발화 + 최대 0.2초 리드인 assert finals[0].duration_s > 0.6 @pytest.mark.skipif(REAL_WEBRTCVAD is None, reason="webrtcvad 미설치 — 게이트 경로가 없다") def test_webrtcvad_gate_filters_pure_tone(monkeypatch): """webrtcvad 가 깔리면 순음은 에너지 VAD 만일 때보다 덜 통과한다. 포터블 exe 와 Windows CI 가 이 경로를 쓴다. 두 경로가 실제로 다르게 동작한다는 사실을 테스트로 고정해 둔다 — 이게 깨져 있는 걸 몰라서 같은 테스트가 플랫폼에 따라 다른 결과를 냈다. """ energy_only = Segmenter(config()) energy_out = energy_only.push(tone(800)) + energy_only.push(silence(600)) monkeypatch.setattr(segmenter_mod, "webrtcvad", REAL_WEBRTCVAD) gated = Segmenter(config()) gated_out = gated.push(tone(800)) + gated.push(silence(600)) energy_total = sum(s.duration_s for s in energy_out if s.is_final) gated_total = sum(s.duration_s for s in gated_out if s.is_final) assert energy_total > 0.7 # 에너지 VAD 는 순음을 발화로 본다 assert gated_total < energy_total # webrtcvad 는 사람 목소리가 아니라고 걸러낸다