Files
live-app-translator/tests/test_segmenter.py
EJClaw 1a87ec6677 feat: Hearo 1차 구현 — 프로그램 소리 실시간 번역 자막
프로그램별 오디오를 캡처해 로컬 GPU에서 음성인식→번역하고 화면 위
자막으로 보여주는 데스크톱 앱. 한/영/일/중 4개 언어.

구성
- audio: WASAPI 프로그램별 캡처(C++ 보조 프로그램) + 장치 루프백 폴백,
  적응형 VAD 발화 분할
- models: 속도~품질 5단계 티어, faster-whisper + CTranslate2/LLM 2백엔드,
  용어집(플레이스홀더 보호 + 프롬프트 주입)
- core: Qt 비의존 파이프라인 엔진 (캡처/분할/추론 3스레드, 큐 연결)
- ui: 사이드바 5화면 + 무테두리 항상위 자막 오버레이, 자체 다크 테마

모델 선정 근거는 docs/MODELS.md, 추가학습 가능 여부와 방법은
docs/FINETUNING.md 참고.

검증: pytest 39개 통과 (GPU·오디오 장치 없이 실행), ruff clean

Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
2026-09-21 10:47:11 +09:00

79 lines
2.4 KiB
Python

import numpy as np
from hearo.audio.segmenter import Segmenter, SegmenterConfig
from hearo.constants import SAMPLE_RATE
def tone(ms: int, amplitude: float = 0.3) -> np.ndarray:
n = SAMPLE_RATE * ms // 1000
t = np.arange(n, dtype=np.float32) / SAMPLE_RATE
return (np.sin(2 * np.pi * 220 * t) * amplitude).astype(np.float32)
def silence(ms: int) -> np.ndarray:
return np.zeros(SAMPLE_RATE * ms // 1000, dtype=np.float32)
def config(**kw) -> SegmenterConfig:
base = dict(silence_ms=300, min_segment_ms=200, max_segment_ms=5000,
partial_interval_ms=0)
base.update(kw)
return SegmenterConfig(**base)
def test_speech_then_silence_emits_one_final_segment():
seg = Segmenter(config())
out = seg.push(silence(200))
assert out == []
out += seg.push(tone(800))
out += seg.push(silence(600))
finals = [s for s in out if s.is_final]
assert len(finals) == 1
assert 0.7 <= finals[0].duration_s <= 1.8
def test_short_blip_is_discarded():
seg = Segmenter(config(min_segment_ms=500))
out = seg.push(tone(60)) + seg.push(silence(600))
assert out == []
def test_max_length_forces_a_cut():
seg = Segmenter(config(max_segment_ms=1000))
out = seg.push(tone(3000))
assert len([s for s in out if s.is_final]) >= 2
def test_partial_results_are_emitted_while_speaking():
seg = Segmenter(config(partial_interval_ms=300))
out = seg.push(tone(1500))
partials = [s for s in out if not s.is_final]
assert len(partials) >= 2
# 중간 결과는 누적된다
assert partials[-1].duration_s > partials[0].duration_s
def test_flush_returns_pending_speech():
seg = Segmenter(config())
assert seg.push(tone(700)) == [] # 아직 침묵이 안 왔으니 확정 없음
leftover = seg.flush()
assert leftover is not None and leftover.is_final
assert seg.flush() is None
def test_continuous_silence_never_emits():
seg = Segmenter(config())
for _ in range(10):
assert seg.push(silence(200)) == []
def test_lead_in_is_prepended():
"""발화 직전 오디오가 붙어 첫 음절이 잘리지 않아야 한다."""
seg = Segmenter(config(lead_in_ms=200))
seg.push(silence(400))
out = seg.push(tone(600)) + seg.push(silence(600))
finals = [s for s in out if s.is_final]
assert len(finals) == 1
# 0.6초 발화 + 최대 0.2초 리드인
assert finals[0].duration_s > 0.6