Windows CI 에서 test_segmenter.py 5개가 실패하고 로컬에서는 통과했다. 플랫폼 차이가 아니라 선택 의존성 차이였다. 테스트 입력은 220Hz 순음이다. `_is_speech` 는 에너지 판정과 webrtcvad 를 AND 로 묶는데, webrtcvad 는 사람 목소리로 학습돼 있어 순음을 발화로 보지 않는다. 포터블 exe 의 requirements 에 webrtcvad-wheels 가 들어 있으니 Windows CI 는 게이트가 켜진 환경이고, 개발 venv 에는 없어서 안 드러났다. (개발 venv 에 webrtcvad-wheels 를 넣으면 리눅스에서도 5개가 똑같이, 같은 수치로 깨지는 것을 확인했다.) - 이 파일이 검증하려는 건 분할 상태 기계이므로 autouse fixture 로 선택 의존성을 끊어 환경과 무관하게 같은 경로를 시험한다 - 게이트 동작 자체는 test_webrtcvad_gate_filters_pure_tone 이 따로 본다 (webrtcvad 없으면 skip) - dev extras 에 webrtcvad-wheels 를 넣어 같은 환경 드리프트가 재발하지 않게 한다
122 lines
4.7 KiB
Python
122 lines
4.7 KiB
Python
import numpy as np
|
|
import pytest
|
|
|
|
from livesub.audio import segmenter as segmenter_mod
|
|
from livesub.audio.segmenter import Segmenter, SegmenterConfig
|
|
from livesub.constants import SAMPLE_RATE
|
|
|
|
#: webrtcvad 는 선택 의존성이다. 있으면 아래 게이트 테스트가 돌고 없으면 skip 된다.
|
|
REAL_WEBRTCVAD = segmenter_mod.webrtcvad
|
|
|
|
|
|
@pytest.fixture(autouse=True)
|
|
def _energy_vad_only(monkeypatch):
|
|
"""이 파일의 테스트는 에너지 VAD 경로로 고정한다.
|
|
|
|
입력이 220Hz 순음이기 때문이다. webrtcvad 는 사람 목소리로 학습돼 있어
|
|
순음을 발화로 보지 않고, `_is_speech` 는 에너지 판정과 webrtcvad 를 AND 로
|
|
묶는다. 그래서 webrtcvad 가 깔린 환경에서는 이 파일의 테스트 5개가 깨졌다 —
|
|
포터블 exe 의 requirements 에 webrtcvad-wheels 가 들어 있어 Windows CI 가
|
|
정확히 그 환경이고, 개발용 venv 에는 없어서 여태 안 드러났다.
|
|
|
|
고칠 대상은 판정기가 아니라 테스트의 숨은 전제다. 여기서 보려는 건 분할
|
|
상태 기계이므로 선택 의존성을 끊어 환경과 무관하게 같은 경로를 시험한다.
|
|
게이트 동작 자체는 test_webrtcvad_gate_filters_pure_tone 이 본다.
|
|
"""
|
|
monkeypatch.setattr(segmenter_mod, "webrtcvad", None)
|
|
|
|
|
|
def tone(ms: int, amplitude: float = 0.3) -> np.ndarray:
|
|
n = SAMPLE_RATE * ms // 1000
|
|
t = np.arange(n, dtype=np.float32) / SAMPLE_RATE
|
|
return (np.sin(2 * np.pi * 220 * t) * amplitude).astype(np.float32)
|
|
|
|
|
|
def silence(ms: int) -> np.ndarray:
|
|
return np.zeros(SAMPLE_RATE * ms // 1000, dtype=np.float32)
|
|
|
|
|
|
def config(**kw) -> SegmenterConfig:
|
|
base = dict(silence_ms=300, min_segment_ms=200, max_segment_ms=5000,
|
|
partial_interval_ms=0)
|
|
base.update(kw)
|
|
return SegmenterConfig(**base)
|
|
|
|
|
|
def test_speech_then_silence_emits_one_final_segment():
|
|
seg = Segmenter(config())
|
|
out = seg.push(silence(200))
|
|
assert out == []
|
|
out += seg.push(tone(800))
|
|
out += seg.push(silence(600))
|
|
finals = [s for s in out if s.is_final]
|
|
assert len(finals) == 1
|
|
assert 0.7 <= finals[0].duration_s <= 1.8
|
|
|
|
|
|
def test_short_blip_is_discarded():
|
|
seg = Segmenter(config(min_segment_ms=500))
|
|
out = seg.push(tone(60)) + seg.push(silence(600))
|
|
assert out == []
|
|
|
|
|
|
def test_max_length_forces_a_cut():
|
|
seg = Segmenter(config(max_segment_ms=1000))
|
|
out = seg.push(tone(3000))
|
|
assert len([s for s in out if s.is_final]) >= 2
|
|
|
|
|
|
def test_partial_results_are_emitted_while_speaking():
|
|
seg = Segmenter(config(partial_interval_ms=300))
|
|
out = seg.push(tone(1500))
|
|
partials = [s for s in out if not s.is_final]
|
|
assert len(partials) >= 2
|
|
# 중간 결과는 누적된다
|
|
assert partials[-1].duration_s > partials[0].duration_s
|
|
|
|
|
|
def test_flush_returns_pending_speech():
|
|
seg = Segmenter(config())
|
|
assert seg.push(tone(700)) == [] # 아직 침묵이 안 왔으니 확정 없음
|
|
leftover = seg.flush()
|
|
assert leftover is not None and leftover.is_final
|
|
assert seg.flush() is None
|
|
|
|
|
|
def test_continuous_silence_never_emits():
|
|
seg = Segmenter(config())
|
|
for _ in range(10):
|
|
assert seg.push(silence(200)) == []
|
|
|
|
|
|
def test_lead_in_is_prepended():
|
|
"""발화 직전 오디오가 붙어 첫 음절이 잘리지 않아야 한다."""
|
|
seg = Segmenter(config(lead_in_ms=200))
|
|
seg.push(silence(400))
|
|
out = seg.push(tone(600)) + seg.push(silence(600))
|
|
finals = [s for s in out if s.is_final]
|
|
assert len(finals) == 1
|
|
# 0.6초 발화 + 최대 0.2초 리드인
|
|
assert finals[0].duration_s > 0.6
|
|
|
|
|
|
@pytest.mark.skipif(REAL_WEBRTCVAD is None, reason="webrtcvad 미설치 — 게이트 경로가 없다")
|
|
def test_webrtcvad_gate_filters_pure_tone(monkeypatch):
|
|
"""webrtcvad 가 깔리면 순음은 에너지 VAD 만일 때보다 덜 통과한다.
|
|
|
|
포터블 exe 와 Windows CI 가 이 경로를 쓴다. 두 경로가 실제로 다르게
|
|
동작한다는 사실을 테스트로 고정해 둔다 — 이게 깨져 있는 걸 몰라서
|
|
같은 테스트가 플랫폼에 따라 다른 결과를 냈다.
|
|
"""
|
|
energy_only = Segmenter(config())
|
|
energy_out = energy_only.push(tone(800)) + energy_only.push(silence(600))
|
|
|
|
monkeypatch.setattr(segmenter_mod, "webrtcvad", REAL_WEBRTCVAD)
|
|
gated = Segmenter(config())
|
|
gated_out = gated.push(tone(800)) + gated.push(silence(600))
|
|
|
|
energy_total = sum(s.duration_s for s in energy_out if s.is_final)
|
|
gated_total = sum(s.duration_s for s in gated_out if s.is_final)
|
|
assert energy_total > 0.7 # 에너지 VAD 는 순음을 발화로 본다
|
|
assert gated_total < energy_total # webrtcvad 는 사람 목소리가 아니라고 걸러낸다
|