프로그램별 오디오를 캡처해 로컬 GPU에서 음성인식→번역하고 화면 위 자막으로 보여주는 데스크톱 앱. 한/영/일/중 4개 언어. 구성 - audio: WASAPI 프로그램별 캡처(C++ 보조 프로그램) + 장치 루프백 폴백, 적응형 VAD 발화 분할 - models: 속도~품질 5단계 티어, faster-whisper + CTranslate2/LLM 2백엔드, 용어집(플레이스홀더 보호 + 프롬프트 주입) - core: Qt 비의존 파이프라인 엔진 (캡처/분할/추론 3스레드, 큐 연결) - ui: 사이드바 5화면 + 무테두리 항상위 자막 오버레이, 자체 다크 테마 모델 선정 근거는 docs/MODELS.md, 추가학습 가능 여부와 방법은 docs/FINETUNING.md 참고. 검증: pytest 39개 통과 (GPU·오디오 장치 없이 실행), ruff clean Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
46 lines
1.0 KiB
Python
46 lines
1.0 KiB
Python
"""엔진이 UI로 올려보내는 이벤트 타입."""
|
|
|
|
from __future__ import annotations
|
|
|
|
import time
|
|
from dataclasses import dataclass, field
|
|
from enum import Enum
|
|
|
|
|
|
class EngineState(str, Enum):
|
|
IDLE = "idle"
|
|
LOADING = "loading"
|
|
RUNNING = "running"
|
|
STOPPING = "stopping"
|
|
ERROR = "error"
|
|
|
|
|
|
@dataclass
|
|
class TranslationLine:
|
|
"""화면에 뿌릴 자막 한 줄."""
|
|
|
|
source_text: str
|
|
translated_text: str
|
|
source_lang: str
|
|
target_lang: str
|
|
is_final: bool = True
|
|
created_at: float = field(default_factory=time.time)
|
|
#: 발화가 끝난 시점부터 번역이 나오기까지 걸린 시간(초)
|
|
latency_s: float = 0.0
|
|
asr_ms: int = 0
|
|
mt_ms: int = 0
|
|
|
|
@property
|
|
def display(self) -> str:
|
|
return self.translated_text or self.source_text
|
|
|
|
|
|
@dataclass
|
|
class EngineStatus:
|
|
state: EngineState = EngineState.IDLE
|
|
message: str = ""
|
|
progress: float = 0.0
|
|
#: 최근 입력 오디오 레벨 (0.0 ~ 1.0), VU 미터용
|
|
level: float = 0.0
|
|
queue_depth: int = 0
|