Cara Pakai Whisper API untuk Transkripsi Audio Otomatis 2026
Pernah ngerasa capek banget dengerin ulang rekaman meeting 2 jam cuma buat bikin notulen? Atau pengen bikin subtitle video YouTube tapi ngetik manual kelamaan? Nah, Whisper API dari OpenAI ini jawabannya, bro.
Gue udah pakai Whisper API buat berbagai keperluan — dari transkripsi podcast, notulen meeting Zoom, sampai bikin subtitle konten TikTok. Dan hasilnya? Gila sih, akurat banget dan super murah. Di artikel ini gue bakal share step-by-step cara pakainya dari nol.
Apa Itu Whisper API?
Whisper adalah model speech-to-text (STT) dari OpenAI yang dilatih pakai 680.000 jam audio multibahasa. Simpelnya: dia bisa dengerin audio apapun terus ubah jadi teks. Support 99 bahasa termasuk Bahasa Indonesia dengan akurasi yang bikin kaget.
Kelebihan Whisper API dibanding alternatif lain:
- Akurasi tinggi — Bahkan buat audio berisik atau logat kental
- Murah — Cuma $0.006/menit (sekitar Rp 100 per menit)
- Multibahasa — Auto-detect bahasa, bisa juga translate ke English
- Simple — API-nya gampang banget, cuma perlu 5 baris kode
Kalau kamu belum tau bedanya API vs akun login, mending baca dulu perbandingan API key vs akun login untuk pakai AI biar gak salah pilih.
Persiapan: API Key OpenAI
Sebelum mulai coding, kamu butuh API key OpenAI. Ada 2 opsi:
Opsi 1: Daftar langsung ke OpenAI Butuh kartu kredit internasional (Visa/Master) yang support pembayaran USD. Ribet buat orang Indonesia karena banyak kartu lokal ditolak.
Opsi 2: Beli API key di reseller lokal Ini yang gue rekomendasiin. Bayar pakai QRIS atau transfer bank, langsung dapet API key siap pakai. Cek aja di abdijualan.online, harganya kompetitif banget.
Kalau masih bingung soal keamanan beli akun/API online, baca cara aman beli akun digital online anti-scam dulu ya.
Setup Environment
Gue asumsi kamu udah punya Python 3.8+ terinstall. Kalau belum, download dulu dari python.org.
Install library-nya:
pip install openai python-dotenv
Bikin file .env buat simpen API key:
OPENAI_API_KEY=sk-xxxxxxxxxxxxxxxxxxxx
Jangan pernah commit .env ke Git ya. Tambahin ke .gitignore.
Kode Dasar Transkripsi
Ini template minimum buat transkripsi 1 file audio:
from openai import OpenAI
from dotenv import load_dotenv
load_dotenv()
client = OpenAI()
with open("meeting.mp3", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
language="id" # Bahasa Indonesia
)
print(transcript.text)
Udah, gitu aja. Serius. Jalanin script-nya, tunggu beberapa detik (tergantung durasi audio), hasilnya keluar langsung.
Handle File Besar (>25MB)
Whisper API cuma nerima file maksimal 25MB. Kalau rekaman meeting 2 jam, ya pasti lebih. Solusinya potong pakai pydub:
pip install pydub
Butuh install ffmpeg juga di sistem kamu (Windows: download dari ffmpeg.org, Mac: brew install ffmpeg, Linux: sudo apt install ffmpeg).
from pydub import AudioSegment
from openai import OpenAI
client = OpenAI()
def transcribe_large_file(filepath, chunk_length_ms=600000): # 10 menit
audio = AudioSegment.from_file(filepath)
chunks = [audio[i:i+chunk_length_ms] for i in range(0, len(audio), chunk_length_ms)]
full_transcript = ""
for i, chunk in enumerate(chunks):
chunk_path = f"chunk_{i}.mp3"
chunk.export(chunk_path, format="mp3")
with open(chunk_path, "rb") as f:
result = client.audio.transcriptions.create(
model="whisper-1",
file=f,
language="id"
)
full_transcript += result.text + " "
return full_transcript
hasil = transcribe_large_file("podcast_2jam.mp3")
print(hasil)
Gampang kan? Audio 2 jam dipecah jadi 12 chunk masing-masing 10 menit, di-transkripsi satu-satu, terus digabung.
Output Format: Text, SRT, VTT
Whisper bisa output ke berbagai format. Buat bikin subtitle YouTube, pakai format SRT:
with open("video.mp4", "rb") as audio_file:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
response_format="srt", # atau "vtt", "json", "verbose_json"
language="id"
)
with open("subtitle.srt", "w", encoding="utf-8") as f:
f.write(transcript)
Hasilnya file .srt yang tinggal drag-drop ke video editor kayak CapCut atau Premiere. Auto-subtitle done.
Kombinasi dengan GPT untuk Notulen Otomatis
Nah ini yang keren. Setelah dapet transkripsi, langsung feed ke GPT buat bikin ringkasan meeting:
def bikin_notulen(transcript):
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "Kamu asisten yang bikin notulen meeting yang rapi. Format: 1) Ringkasan singkat, 2) Poin-poin penting, 3) Action items dengan PIC."},
{"role": "user", "content": f"Bikin notulen dari transkrip meeting berikut:\n\n{transcript}"}
]
)
return response.choices[0].message.content
notulen = bikin_notulen(hasil)
print(notulen)
Total biaya transkripsi 1 jam + notulen GPT-4o-mini: kurang dari Rp 10.000. Gila hemat kan?
Kalau mau lebih detail soal ini, baca cara merangkum rekaman meeting pakai ChatGPT & Claude — gue bahas beberapa workflow alternatif juga.
Use Case Real yang Bisa Kamu Bikin
Beberapa ide project pakai Whisper API:
1. Bot Transkripsi Voice Note WhatsApp Bikin bot yang auto-transkripsi voice note masuk. Cocok buat orang yang gak suka dengerin VN. Kombinasiin sama tutorial cara pakai OpenAI API untuk auto-reply WhatsApp.
2. Podcast to Blog Post Rekaman podcast → transkripsi → GPT rewrite jadi artikel blog. 1 podcast bisa jadi 3-5 artikel SEO.
3. Interview Transcription Service Jual jasa transkripsi interview buat wartawan/peneliti. Harga pasaran Rp 15.000-30.000 per jam audio. Modal kamu Rp 100. Margin gila.
4. Auto-Subtitle untuk Konten TikTok/Reels Semua konten viral pakai subtitle. Otomatisin pakai Whisper + FFmpeg buat burn subtitle ke video.
5. Customer Support Analytics Rekaman call center → transkripsi → analisis pakai GPT buat cari komplain umum, sentiment analysis, dll.
Tips Hemat Kuota Token
Beberapa trick biar lebih hemat:
- Compress audio dulu — Convert ke MP3 bitrate 64kbps sebelum upload. Kualitas transkripsi tetep bagus tapi file lebih kecil.
- Skip silence — Pakai
pydub.silence.split_on_silence()buat buang jeda hening. Audio 1 jam bisa jadi 40 menit doang. - Batch processing — Kalau proses banyak file, jalanin paralel pakai
asynciobiar cepet.
Lebih detail soal optimasi biaya API, cek tips hemat kuota token API AI.
Alternatif Selain Whisper
Fair aja, gue kasih tau alternatifnya:
- AssemblyAI — Lebih mahal ($0.37/jam) tapi ada fitur speaker diarization
- Deepgram — Cepat banget, cocok buat real-time
- Google Speech-to-Text — Bagus tapi setup ribet
- Whisper self-hosted — Gratis kalau punya GPU sendiri, tapi ribet
Buat 90% use case, Whisper API OpenAI udah paling worth it dari sisi harga + akurasi + simplicity.
Penutup
Whisper API itu game changer buat siapapun yang kerja dengan audio. Dulu transkripsi 1 jam bisa makan 3-4 jam kerja manual. Sekarang? 5 menit selesai dengan biaya Rp 6.000.
Kalau kamu belum punya API key OpenAI, mampir aja ke abdijualan.online. Prosesnya cepet, harga jelas, bisa bayar QRIS. Cocok buat kamu yang mau eksperimen tanpa ribet urus kartu kredit internasional.
Sekarang tinggal action. Coba ambil 1 rekaman audio yang kamu punya, jalanin script di atas, dan rasain sendiri betapa magisnya teknologi ini. Selamat ngoprek!