이름을 Hearo → LiveSub 로 변경. 말장난보다 하는 일이 바로 보이는 쪽이 낫다. 자막 on/off - 전역 단축키 Ctrl+Alt+S (자막) / Ctrl+Alt+D (번역) — Windows RegisterHotKey + 네이티브 이벤트 필터라 게임 창이 떠 있어도 동작. 다른 OS 에서는 no-op - 단축키·체크박스·우클릭 메뉴가 모두 같은 경로를 타도록 통합 모니터 선택 + 디스코드식 배치 - placement.py: Qt 비의존 배치 계산 (모니터 목록 → 9분할 좌표) - AnchorGrid 위젯으로 3x3 위치 선택, 드래그하면 자유 배치로 전환 - 모니터 구성이 바뀌어도 자막이 화면 밖으로 사라지지 않도록 클램프 GPU 저부하 모드 (기본 켜짐) - 연산 정밀도 int8 강등, VRAM 상한 35%, 추론 후 60ms 양보, 300초 무음 시 모델 언로드, 중간 결과 비활성 - 기본 티어를 균형(6GB) → 신속(4GB) 으로 하향 - 8GB GPU 기준 자막 2.8GB / 게임 5.2GB 게임 용어집 번들 (304개) - 롤 74 · 발로란트 59 · 오버워치2 49 · FPS공통 46 · 마크 38 · 방송 38 - 체크박스로 켜고 끄며, 사용자가 직접 등록한 항목이 항상 우선 검증: pytest 91개 통과 (배치 14 + 팩 12 + UI 6 신규), ruff clean Co-Authored-By: Claude Opus 4.7 <noreply@anthropic.com>
5.9 KiB
구조
데이터 흐름
[캡처 스레드] [분할 스레드] [추론 스레드] [GUI 스레드]
livesub_capture.exe → Segmenter (VAD) → Whisper → 번역 모델 → 자막 오버레이
또는 WASAPI 발화 단위로 절단 용어집 적용 컨트롤 창 로그
↓ ↓ ↓ ↑
오디오 큐 구간 큐(최대 32) TranslationLine Qt Signal
(16kHz mono f32) 확정 / 중간결과
세 워커 스레드는 모두 큐로만 연결된다. 어느 한 단계가 밀려도 나머지가 멈추지 않는다. 큐가 가득 차면 오래된 오디오를 버린다 — 실시간 자막에서는 밀린 소리보다 지금 나는 소리가 항상 더 가치 있기 때문이다.
패키지
src/livesub/
constants.py 전역 상수, 언어 표, 경로
config.py 설정 dataclass + JSON 영속화
app.py 진입점
audio/
base.py CaptureBackend 추상 클래스, 리샘플링
process_loopback.py 프로그램별 캡처 (네이티브 보조 프로그램 구동)
wasapi_loopback.py 출력 장치 전체 캡처 (PyAudioWPatch)
file_source.py WAV 재생 (테스트·데모용)
segmenter.py 적응형 VAD로 발화 구간 절단
models/
tiers.py 5단계 티어 + 프롬프트 형식 정의
asr.py faster-whisper 래퍼
translator.py CTranslate2 / Transformers 두 백엔드
glossary.py 용어집 (플레이스홀더 보호 + 프롬프트 주입)
packs.py 게임별 기본 용어집 팩 로드·병합
manager.py 티어별 모델 쌍 로드·해제, GPU 탐지, VRAM 상한
core/
engine.py 파이프라인 오케스트레이션 (Qt 비의존)
events.py TranslationLine, EngineStatus
ui/
theme.py 디자인 토큰 + QSS
overlay.py 자막 창 + 공용 렌더링 함수
placement.py 모니터 목록 + 9분할 배치 계산 (Qt 비의존)
hotkeys.py 전역 단축키 (Windows RegisterHotKey)
main_window.py 사이드바 + 페이지 스택
pages/ 홈 / 모델 / 자막 / 용어집 / 설정
widgets/ Card, StatusPill, LevelMeter, AnchorGrid
resources/glossaries/ 게임별 기본 용어집 JSON (롤·발로란트·옵치2·마크 등)
native/process_loopback/ WASAPI process loopback C++ 보조 프로그램
scripts/finetune_mt.py LoRA 추가학습
설계 판단
캡처를 별도 실행 파일로 뺀 이유
WASAPI의 ActivateAudioInterfaceAsync + AUDIOCLIENT_ACTIVATION_TYPE_PROCESS_LOOPBACK
은 COM 비동기 콜백을 요구한다. ctypes로 COM vtable을 흉내 내는 것보다 C++ 200줄이
훨씬 안전하고 디버깅이 쉽다. 파이프로 생 PCM만 주고받으므로 인터페이스도 단순하다.
보조 프로그램이 없으면 capture_capabilities() 가 이를 알려주고 장치 루프백으로
자동 폴백한다. 빌드 없이도 프로그램은 동작한다.
게임이 먼저다
이 프로그램은 게임 위에 얹혀 도는 것이 기본 용도라, 자막 품질보다 게임 프레임을 지키는 쪽이 대체로 더 중요하다. 저부하 모드는 네 방향에서 GPU를 양보한다.
- 연산 정밀도 강등 (
ModelManager.effective_*_spec) — float16 → int8. 티어 정의 자체를 건드리지 않고 파생 사양만 바꾸므로, 모드를 끄면 즉시 원복된다. - VRAM 상한 (
apply_vram_limit) — 모델을 올리기 전에 걸어야 실제로 먹는다. 게임과 동시에 돌 때 프레임을 죽이는 주범은 연산 시간이 아니라 VRAM 고갈이다. 게임이 쓸 메모리를 우리가 먹으면 텍스처 스트리밍이 시스템 메모리로 밀려난다. - 추론 후 양보 — 문장 하나를 처리하고 수십 ms 쉰다. 연속 발화 때 GPU를 독점하지 않기 위해서다.
- 유휴 언로드 — 조용한 구간이 길어지면 모델을 통째로 내린다. 그래서
_infer_loop은 모델 참조를 캐시하지 않고 매번models.recognizer()를 부른다.
중간 결과는 번역하지 않는다
말하는 도중에도 인식 결과를 흐리게 보여주면 체감 지연이 크게 줄어든다. 하지만 매번 번역까지 돌리면 GPU가 몇 배로 바빠지고, 문장이 완성되기 전 번역은 어차피 틀린다. 그래서 중간 결과는 원문만, 확정 문장만 번역한다.
배치 계산을 Qt에서 떼어냈다
placement.py 는 ScreenInfo 라는 순수 데이터만 받아 좌표를 계산한다. 덕분에
모니터가 없는 CI 환경에서도 "두 번째 모니터 하단 중앙", "음수 좌표 모니터",
"화면보다 큰 자막 창" 같은 경우를 전부 테스트할 수 있다 (tests/test_placement.py).
자막이 화면 밖으로 나가 영영 안 보이는 사고는 여기서 막는다.
UI 코드와 렌더링 코드 분리
자막 설정 미리보기와 실제 오버레이가 paint_subtitle() 하나를 공유한다.
QSS로 미리보기를 흉내 내면 text-shadow 미지원 같은 이유로 실제와 어긋난다.
엔진은 Qt를 모른다
core/engine.py 는 콜백만 받는다. Qt 의존은 MainWindow 가 콜백을 Signal로
다시 던지는 지점에만 있다. 덕분에 GPU도 오디오 장치도 없는 환경에서 파이프라인
전체를 테스트할 수 있다 (tests/test_pipeline.py).
테스트
pytest 전체가 GPU·오디오 장치 없이 돈다.
test_segmenter.py— 합성 사인파로 VAD 절단 검증test_pipeline.py— 가짜 캡처/인식/번역으로 엔진 종단 검증test_glossary.py— 최장일치, 단어경계, 왕복 변환test_config.py— 스키마 변경 내성test_ui_smoke.py— offscreen 렌더링으로 화면 생성 및 자막 픽셀 검증