feat: Hearo 1차 구현 — 프로그램 소리 실시간 번역 자막
프로그램별 오디오를 캡처해 로컬 GPU에서 음성인식→번역하고 화면 위 자막으로 보여주는 데스크톱 앱. 한/영/일/중 4개 언어. 구성 - audio: WASAPI 프로그램별 캡처(C++ 보조 프로그램) + 장치 루프백 폴백, 적응형 VAD 발화 분할 - models: 속도~품질 5단계 티어, faster-whisper + CTranslate2/LLM 2백엔드, 용어집(플레이스홀더 보호 + 프롬프트 주입) - core: Qt 비의존 파이프라인 엔진 (캡처/분할/추론 3스레드, 큐 연결) - ui: 사이드바 5화면 + 무테두리 항상위 자막 오버레이, 자체 다크 테마 모델 선정 근거는 docs/MODELS.md, 추가학습 가능 여부와 방법은 docs/FINETUNING.md 참고. 검증: pytest 39개 통과 (GPU·오디오 장치 없이 실행), ruff clean Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
This commit is contained in:
45
src/hearo/core/events.py
Normal file
45
src/hearo/core/events.py
Normal file
@@ -0,0 +1,45 @@
|
||||
"""엔진이 UI로 올려보내는 이벤트 타입."""
|
||||
|
||||
from __future__ import annotations
|
||||
|
||||
import time
|
||||
from dataclasses import dataclass, field
|
||||
from enum import Enum
|
||||
|
||||
|
||||
class EngineState(str, Enum):
|
||||
IDLE = "idle"
|
||||
LOADING = "loading"
|
||||
RUNNING = "running"
|
||||
STOPPING = "stopping"
|
||||
ERROR = "error"
|
||||
|
||||
|
||||
@dataclass
|
||||
class TranslationLine:
|
||||
"""화면에 뿌릴 자막 한 줄."""
|
||||
|
||||
source_text: str
|
||||
translated_text: str
|
||||
source_lang: str
|
||||
target_lang: str
|
||||
is_final: bool = True
|
||||
created_at: float = field(default_factory=time.time)
|
||||
#: 발화가 끝난 시점부터 번역이 나오기까지 걸린 시간(초)
|
||||
latency_s: float = 0.0
|
||||
asr_ms: int = 0
|
||||
mt_ms: int = 0
|
||||
|
||||
@property
|
||||
def display(self) -> str:
|
||||
return self.translated_text or self.source_text
|
||||
|
||||
|
||||
@dataclass
|
||||
class EngineStatus:
|
||||
state: EngineState = EngineState.IDLE
|
||||
message: str = ""
|
||||
progress: float = 0.0
|
||||
#: 최근 입력 오디오 레벨 (0.0 ~ 1.0), VU 미터용
|
||||
level: float = 0.0
|
||||
queue_depth: int = 0
|
||||
Reference in New Issue
Block a user