SubtitledByAI Architecture

Bagaimana Kami Membuat Subtitle Sakurazaka46

Sebagai penggemar Sakurazaka46, kami ingin membantu para Buddies Indonesia menikmati setiap momen — mulai dari dialog cepat di variety show, celetukan spontan para member, drama emosional di balik layar, hingga penampilan panggung live.

Menerjemahkan video berdurasi panjang secara manual dari nol membutuhkan waktu berhari-hari per episode. Karena itulah lahir proyek SubtitledByAI: sebuah pipeline otomatisasi kecerdasan buatan untuk mentranskripsi audio percakapan bahasa Jepang dan menerjemahkannya secara kontekstual ke Bahasa Indonesia dengan standar timing presisi fansub.

Stack Utama:Gemini 2.5 Pro (Audio Ingestion)Claude 3.5 Sonnet / GPT-4oFastAPI & Python 3.11FFmpeg Silencedetectyt-dlp

Riwayat & Evolusi Pipeline

v1.0WhisperAI-subs (Lokal)
GitHub Repository ↗

Versi pertama dieksekusi seutuhnya pada komputer lokal (Python script). Transkripsi audio Jepang menggunakan Whisper API dari OpenAI, lalu hasil teks transkrip diterjemahkan ke Bahasa Indonesia dengan model GPT-4o. Cukup untuk pembuktian konsep awal, namun rentan pada dialog cepat dan keterbatasan hardware lokal.

Python LocalOpenAI Whisper APIGPT-4oBiaya API: ~USD $0.33 / 30 mnt
v2.0Migrasi Cloud (Google Colab)
Colab Notebook ↗

Arsitektur pipeline dipindahkan ke Google Colab. Perubahan ini memungkinkan proses pembuatan subtitle dijalankan secara fleksibel melalui perangkat mobile tanpa perlu menyalakan komputer rumah. Akurasi hasil tetap setara dengan v1.0.

Google Colab CloudWhisper APIGPT-4oBiaya API: ~USD $0.33 / 30 mnt
v2.5Optimasi Biaya (kotoba-whisper-v2.0)
Colab Notebook ↗

Masih berada di lingkungan Colab, namun transkripsi beralih dari Whisper API berbayar ke model open-source kotoba-whisper-v2.0 yang di-host langsung pada GPU Colab (bebas biaya komputasi). Kualitas pengenalan istilah Jepang meningkat signifikan sementara pengeluaran API terpangkas drastis hanya untuk tahap terjemahan GPT-4o.

Google Colab GPUkotoba-whisper-v2.0 (Lokal)GPT-4oBiaya API: ~USD $0.10 / 30 mnt
v3.0 AktifGemini 2.5 Pro Multimodal Audio Pipeline
Generasi Terbaru

Generasi ini merupakan perombakan arsitektur menyeluruh. Kami meniadakan Whisper standar dan beralih ke Gemini 2.5 Pro via Google AI Studio Files API dengan input audio langsung.

Tidak seperti Whisper yang hanya memproses gelombang suara menjadi teks literal, Gemini mampu mendengar secara kontekstual. Model dapat mengenali pergantian antar-pembicara (speaker diarization), memahami intonasi bercanda atau sarkasme khas variety show, mendeteksi sound effect latar (BGM / tebeng SFX), dan membedakan kata-kata homofon bahasa Jepang yang serupa dari nada suaranya.

Tahapan Alur Kerja SubtitledByAI v3.0

1

Ingestion Media & Ekstraksi Audio

Pengunduhan otomatis melalui yt-dlp dari tautan YouTube atau input berkas lokal video RAW episode.

2

Normalisasi & Silencedetect Chunking

FFmpeg mendeteksi hening suara alami untuk memecah audio menjadi chunk-chunk logis tanpa memotong kalimat di tengah pembicaraan.

3

Transkripsi Multimodal (Gemini 2.5 Pro)

Chunk audio diproses melalui Files API. Gemini menghasilkan transkripsi Jepang akurat beserta timestamp per baris ucapan dan indikasi pembicara.

4

Merge Deterministik & Deduplikasi

Seluruh chunk digabungkan kembali dengan algoritma fuzzy matching untuk mengeliminasi tumpang-tindih kalimat pada batas segmen.

5

Translasi Batch JSON & Penyesuaian Budaya Idol

Teks diterjemahkan dalam batch ≤100 ujaran menggunakan Claude 3.5 Sonnet / Gemini Flash dengan kamus khusus istilah Sakurazaka46 dan checkpoint berkala.

6

Post-Processing Durasi & Kontrol CPS

Koreksi otomatis batas durasi tayang subtitle (0.7 detik s/d 7.5 detik), perapatan jeda mikro, serta deteksi Characters Per Second (CPS > 25) untuk audit manual.

7

Ekspor Rilis Subtitle (.ass & .srt)

Kompilasi berkas styling khas HikaLeon (.ass dengan font & outline) dan .srt standar, disertai arsip JSON transkrip mentah.

FastAPI LocalhostGemini 2.5 Pro AudioClaude / Flash / GPT-4oBiaya Token: ~USD $1.00 – $1.50 / 30 mnt

Benchmark Kualitas & Akurasi

v1.0 (Whisper API Lokal)55 / 100 (Timing buruk di dialog padat)
v2.0 (Google Colab Cloud)55 / 100 (Identik dengan v1.0)
v2.5 (kotoba-whisper-v2.0)60 / 100 (Kosakata idol sedikit membaik)
v3.0 (Gemini 2.5 Pro Multimodal)92 / 100 (Timing presisi, konteks akurat)

Evaluasi Komparasi: Pada model generasi Whisper tradisional (v1–v2.5), ketika beberapa member Sakurazaka46 berbicara bersamaan atau tertawa, teks transkripsi sering kehilangan timing dan memicu desinkronisasi.

Pada v3.0, kemampuan multimodal Gemini menerima spektrum audio biner secara penuh, memungkinkan pemahaman intonasi dengan batas deviasi timing rata-rata di bawah 0.5 detik.

Estimasi Biaya API per Episode (~30 Menit)

v1.0 & v2.0 (Whisper API + GPT-4o)$0.20 – $0.33
v2.5 (kotoba-whisper gratis + GPT-4o)$0.10 – $0.15
v3.0 (Gemini 2.5 Pro Audio Ingestion)$1.00 – $1.50
Mengapa Dukungan Supporter Sangat Dibutuhkan:

Gemini memiliki batasan free tier harian yang hanya mencukupi ~1 episode per hari. Untuk merilis beragam show (Sokomagattara, Chokosaku, Sakura Meets, Documentary) secara serentak tanpa antrean panjang, token API berbayar harus digunakan. Dukungan dari para penikmat fansub melalui Trakteer sepenuhnya disalurkan untuk pembiayaan token ini.

Keterbukaan & Kode Sumber

Kami percaya pada transparansi proses pembuatan subtitle. Kamu dapat meninjau kode script maupun notebook yang kami gunakan secara terbuka melalui tautan berikut:

Ingin mengetahui sistem rilis dan donasi?

Kunjungi halaman Tentang untuk melihat sistem tier supporter Trakteer.

Ke Halaman Tentang