🎤 Speech to Text
Konfigurasi
Model Whisper:
⚠ Peringatan: Model Large-v3 berukuran besar (1.6B params). Transkripsi di server CPU-only ini akan memakan waktu 2-3x lebih lama.
Format Output:
📁

Pilih file audio atau drag & drop

Mendukung MP3, WAV, M4A, OGG, FLAC, WebM (Maks. 25MB)

Klik tombol untuk mulai rekam
00:00

Interactive API Docs

FastAPI menyediakan Swagger UI interaktif yang dapat diakses di:

http://IP_SERVER_ANDA:9999/docs

Endpoint: Transcribe Audio

Kirim file audio via request multipart/form-data POST.

curl -X POST http://IP_SERVER_ANDA:9999/transcribe \ -F "file=@/path/ke/audio_anda.mp3" \ -F "model=medium" \ -F "language=id"

Parameter Form:

  • file: Berkas audio (WAV, MP3, M4A, OGG, FLAC, WebM). Maks. 25MB.
  • model (opsional): Model Whisper (medium atau large-v3). Default: medium.
  • language (opsional): Kode bahasa dua digit (misal: id untuk Indonesia, en untuk Inggris).
Memproses...

Hasil Transkripsi

Waktu proses: 0 detik
Menghubungkan ke server... Model: -