Whisper 무음 반복 자막 줄이기: 한국어 6조건 실험과 SRT 도구

Whisper 자막에 말하지 않은 문장이 반복된다면 먼저 무음 구간을 확인해 보자. Core Insight의 한국어 합성 음성 실험에서는 VAD와 단어별 시간 정렬을 함께 켰을 때 끝 무음의 반복 자막과 중간 무음에 길게 남는 자막을 줄일 수 있었다. 같은 입력에서 기본 설정은…
AI 도구와 오픈소스를 직접 써보고 확인한 것을 정리한다.

Whisper 자막에 말하지 않은 문장이 반복된다면 먼저 무음 구간을 확인해 보자. Core Insight의 한국어 합성 음성 실험에서는 VAD와 단어별 시간 정렬을 함께 켰을 때 끝 무음의 반복 자막과 중간 무음에 길게 남는 자막을 줄일 수 있었다. 같은 입력에서 기본 설정은…

Gemini 3.8 Live는 말로 대화하면서 화면 속 정보를 참고하고, 연결된 도구로 작업을 처리하는 Google의 음성 AI 모델입니다. 기본형과 Extended Thinking은 용도가 다릅니다. 짧게 대화할 때와 여러 조건을 따져야 할 때 필요한 모델이 다를 수 있습니다. 확인일: 2026년 9월 21일. 공식…
OpenScreen은 화면 녹화 하나를 제품 홍보 영상으로 바꿔주는 오픈소스다. 배경과 둥근 모서리와 그림자를 입히고, 커서를 갈아 끼우고, 마우스가 머문 자리를 알아서 확대한다. 계정을 만들지 않고 API 키도 넣지 않는다. 윈도우·맥·리눅스에서 돌고 상업적 사용도 무료다. 다만 문서가 내세우는 자동 확대는 조건이…

img2threejs는 사진 한 장을 주면 그 물체를 Three.js 코드로 다시 짜주는 오픈소스 스킬이다. 결과물은 3D 파일이 아니라 부품 이름이 붙은 TypeScript 소스이고, 각 단계마다 사진과 렌더를 겹쳐 점수를 매기는 검사가 붙는다. 다만 문서에 적힌 순서를 그대로 따라가면 첫 단계에서 멈추며,…
MoneyPrinterTurbo는 주제 한 줄을 넣으면 대본, 음성, 자막, 화면을 자동으로 붙여 세로 숏폼 영상 한 편을 만들어내는 오픈소스다. MIT 라이선스라 구독료가 없고, Windows에서는 압축 파일 하나를 풀고 start.bat을 누르면 켜진다. Python도 ffmpeg도 따로 깔지 않는다. 이 글은 설치 경로 세…