프로그램별 오디오를 캡처해 로컬 GPU에서 음성인식→번역하고 화면 위 자막으로 보여주는 데스크톱 앱. 한/영/일/중 4개 언어. 구성 - audio: WASAPI 프로그램별 캡처(C++ 보조 프로그램) + 장치 루프백 폴백, 적응형 VAD 발화 분할 - models: 속도~품질 5단계 티어, faster-whisper + CTranslate2/LLM 2백엔드, 용어집(플레이스홀더 보호 + 프롬프트 주입) - core: Qt 비의존 파이프라인 엔진 (캡처/분할/추론 3스레드, 큐 연결) - ui: 사이드바 5화면 + 무테두리 항상위 자막 오버레이, 자체 다크 테마 모델 선정 근거는 docs/MODELS.md, 추가학습 가능 여부와 방법은 docs/FINETUNING.md 참고. 검증: pytest 39개 통과 (GPU·오디오 장치 없이 실행), ruff clean Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
79 lines
2.4 KiB
Python
79 lines
2.4 KiB
Python
import numpy as np
|
|
|
|
from hearo.audio.segmenter import Segmenter, SegmenterConfig
|
|
from hearo.constants import SAMPLE_RATE
|
|
|
|
|
|
def tone(ms: int, amplitude: float = 0.3) -> np.ndarray:
|
|
n = SAMPLE_RATE * ms // 1000
|
|
t = np.arange(n, dtype=np.float32) / SAMPLE_RATE
|
|
return (np.sin(2 * np.pi * 220 * t) * amplitude).astype(np.float32)
|
|
|
|
|
|
def silence(ms: int) -> np.ndarray:
|
|
return np.zeros(SAMPLE_RATE * ms // 1000, dtype=np.float32)
|
|
|
|
|
|
def config(**kw) -> SegmenterConfig:
|
|
base = dict(silence_ms=300, min_segment_ms=200, max_segment_ms=5000,
|
|
partial_interval_ms=0)
|
|
base.update(kw)
|
|
return SegmenterConfig(**base)
|
|
|
|
|
|
def test_speech_then_silence_emits_one_final_segment():
|
|
seg = Segmenter(config())
|
|
out = seg.push(silence(200))
|
|
assert out == []
|
|
out += seg.push(tone(800))
|
|
out += seg.push(silence(600))
|
|
finals = [s for s in out if s.is_final]
|
|
assert len(finals) == 1
|
|
assert 0.7 <= finals[0].duration_s <= 1.8
|
|
|
|
|
|
def test_short_blip_is_discarded():
|
|
seg = Segmenter(config(min_segment_ms=500))
|
|
out = seg.push(tone(60)) + seg.push(silence(600))
|
|
assert out == []
|
|
|
|
|
|
def test_max_length_forces_a_cut():
|
|
seg = Segmenter(config(max_segment_ms=1000))
|
|
out = seg.push(tone(3000))
|
|
assert len([s for s in out if s.is_final]) >= 2
|
|
|
|
|
|
def test_partial_results_are_emitted_while_speaking():
|
|
seg = Segmenter(config(partial_interval_ms=300))
|
|
out = seg.push(tone(1500))
|
|
partials = [s for s in out if not s.is_final]
|
|
assert len(partials) >= 2
|
|
# 중간 결과는 누적된다
|
|
assert partials[-1].duration_s > partials[0].duration_s
|
|
|
|
|
|
def test_flush_returns_pending_speech():
|
|
seg = Segmenter(config())
|
|
assert seg.push(tone(700)) == [] # 아직 침묵이 안 왔으니 확정 없음
|
|
leftover = seg.flush()
|
|
assert leftover is not None and leftover.is_final
|
|
assert seg.flush() is None
|
|
|
|
|
|
def test_continuous_silence_never_emits():
|
|
seg = Segmenter(config())
|
|
for _ in range(10):
|
|
assert seg.push(silence(200)) == []
|
|
|
|
|
|
def test_lead_in_is_prepended():
|
|
"""발화 직전 오디오가 붙어 첫 음절이 잘리지 않아야 한다."""
|
|
seg = Segmenter(config(lead_in_ms=200))
|
|
seg.push(silence(400))
|
|
out = seg.push(tone(600)) + seg.push(silence(600))
|
|
finals = [s for s in out if s.is_final]
|
|
assert len(finals) == 1
|
|
# 0.6초 발화 + 최대 0.2초 리드인
|
|
assert finals[0].duration_s > 0.6
|