← Resources
By Jordan Malik
— Staff Engineer, Inference
·
· GUIDE
Kapan Self-Hosting LLM Sebenarnya Lebih Murah daripada API
Self-hosting LLM hanya lebih murah daripada API di atas volume token tertentu yang sepenuhnya bergantung pada utilisasi GPU — tidak ada satu angka titik impas yang berlaku universal. Panduan ini membahas perhitungan sebenarnya, mengapa batching dan kuantisasi jadi penentu, biaya operasional tersembunyi, dan mengapa hybrid biasanya merupakan jawaban yang tepat.
Tidak ada satu angka titik impas yang berlaku universal
Jawaban jujur untuk "kapan self-hosting lebih murah?" adalah sebuah rentang yang dibatasi oleh utilisasi, bukan satu angka — itulah sebabnya estimasi yang dipublikasikan bisa berbeda hingga beberapa kali lipat. Masing-masing mengasumsikan harga GPU, tingkat utilisasi, dan API pembanding yang berbeda-beda.
Gambaran umum yang berguna: self-hosting cenderung mengungguli API premium pada volume berkelanjutan yang relatif moderat (beberapa juta token per bulan pada GPU yang terpakai dengan baik), tetapi untuk mengungguli API anggaran yang murah dibutuhkan volume yang jauh lebih besar (puluhan hingga ratusan juta per bulan). Patokan kasar di tengah-tengah adalah beberapa juta token per hari secara berkelanjutan. Di bawah itu, API hampir selalu menang.
Perhitungan biaya GPU
Self-hosting berarti menyewa atau memiliki GPU, dan biaya tetap itulah yang harus "diisi" oleh volume token Anda. H100 on-demand berkisar sekitar $1,50–3,00/jam di cloud GPU khusus (lebih mahal di hyperscaler), sehingga H100 khusus yang berjalan 24/7 berada di kisaran $1.000–5.000 per bulan tergantung tier penyedia.
Biaya bulanan tetap ini berlaku entah Anda memakainya atau tidak — itulah sebabnya biaya per juta token hanya murah pada utilisasi tinggi. Pada utilisasi yang baik, model berukuran sedang bisa mencapai jauh di bawah satu dolar per juta token; pada beban 10%, biaya riil per token naik sekitar sepuluh kali lipat, cukup untuk membuat self-hosting lebih mahal daripada API premium. GPU yang menganggur adalah cara tercepat untuk kalah dalam adu biaya.
Penentunya adalah batching dan kuantisasi
Ada dua tuas yang menggerakkan titik impas lebih dari faktor lain mana pun. Continuous batching (lewat server inferensi modern) adalah mesin ekonominya: melayani banyak permintaan sekaligus pada GPU yang sama bisa memangkas biaya per token secara dramatis — beralih dari satu permintaan sekaligus ke batch besar bisa meningkatkan throughput beberapa kali lipat. Trafik yang naik-turun tajam dengan konkurensi rendah tidak mengisi batch hingga penuh dan berjalan beberapa kali lebih buruk dibanding puncaknya, itulah sebabnya beban kerja yang bersifat bursty kurang cocok untuk self-hosting.
[Kuantisasi](/articles/llm-quantization-explained-gguf) adalah tuas lainnya: FP8 kira-kira menggandakan throughput dengan kerugian kualitas minimal, dan INT4 bisa kira-kira melipattigakannya sekaligus mengecilkan model agar muat di GPU yang lebih kecil dan lebih murah. Bersama-sama, batching dan kuantisasi bisa menggeser biaya per token hingga beberapa kali lipat.
Biaya tersembunyi: operasional
Tagihan GPU bukanlah keseluruhan tagihan. Operasional secara rutin menambah biaya beberapa kali lipat dari biaya hardware mentah: seorang insinyur MLOps bergaji enam digit, dan setiap siklus pembaruan model — kuantisasi ulang, pengujian, deployment ulang — memakan waktu kerja berminggu-minggu. Model open-weight yang "gratis" bisa menyembunyikan biaya rekayasa ratusan ribu dolar per tahun setelah Anda memperhitungkan server inferensi, pengelolaan driver dan CUDA, autoscaling, serta pemantauan.
Inilah pos biaya yang menenggelamkan perhitungan self-hosting yang naif. Biaya per token di lembar spesifikasi mengasumsikan GPU berjalan sendiri; kenyataannya, seseorang harus menjaganya tetap berjalan, dan orang itu tidak gratis.
Kapan API jelas menang (dan faktor di luar biaya)
API adalah pilihan tepat untuk volume rendah atau naik-turun tajam, trafik tak terduga, tim tanpa MLOps internal, serta kebutuhan akan model berkualitas frontier yang tidak bisa Anda jalankan sendiri. Menurut satu estimasi, API adalah pilihan yang lebih baik untuk sebagian besar kasus penggunaan — dan harga API terus turun, yang dari waktu ke waktu mendorong titik impas self-hosting semakin tinggi.
Dua faktor berada sepenuhnya di luar perhitungan biaya: latensi dan privasi. Self-hosting unggul untuk residensi data, beban kerja yang teregulasi, dan latensi in-region yang dapat diprediksi, terlepas dari ekonomi token — lihat [panduan on-premise](/articles/on-premise-ai-for-enterprise) kami. Faktor-faktor ini bisa membenarkan self-hosting bahkan ketika perhitungan biaya murni tidak mendukungnya.
Routing berdasarkan ekonomi dengan osFoundry
Jawaban pragmatisnya adalah hybrid: lakukan routing berdasarkan ekonomi, bukan ideologi. Volume tinggi dan stabil sebaiknya ditempatkan pada inferensi lokal atau milik sendiri, di mana mengisi batch GPU menekan biaya per token. Beban kerja volume menengah yang dapat diprediksi cocok untuk endpoint GPU khusus — throughput yang ramah utilisasi tanpa harus memiliki hardware atau menanggung pengganda operasional secara penuh. Trafik yang naik-turun tajam, rendah, atau tidak dapat diprediksi, serta apa pun yang membutuhkan kualitas frontier, tetap memakai API BYOK bayar-per-token.
osFoundry menangani tuas-tuas yang benar-benar menggerakkan titik impas — kuantisasi, batching, dan tier routing — secara otomatis, serta memungkinkan beban kerja yang sama berjalan secara lokal, pada endpoint khusus, atau melalui API BYOK. Dengan begitu Anda meraih penghematan di tempat self-hosting menang tanpa harus mengelola sendiri CUDA, autoscaling, atau perhitungan duty-cycle. ([Rincian biaya BYOK](/articles/byok-vs-managed-ai-cost-breakdown) kami membahas sisi API dari persamaan ini.)
Frequently asked questions
- Pada volume token berapa self-hosting menjadi lebih murah daripada API?
- Tergantung pada utilisasi, jadi tidak ada satu angka pasti. Secara kasar, self-hosting bisa mengungguli API premium pada beberapa juta token per bulan dengan GPU yang terpakai baik, tetapi untuk mengungguli API anggaran yang murah dibutuhkan puluhan hingga ratusan juta per bulan. Ambang batas patokan umum adalah beberapa juta token per hari secara berkelanjutan — di bawah itu, API biasanya menang.
- Berapa biaya menjalankan H100 per bulan?
- H100 on-demand berkisar sekitar $1,50–3,00/jam di cloud GPU khusus (lebih tinggi di hyperscaler), sehingga instance khusus yang berjalan 24/7 berada di kisaran $1.000–5.000 per bulan tergantung tier penyedia. Biaya tetap itulah yang harus dipenuhi oleh volume token Anda agar self-hosting menjadi menguntungkan.
- Mengapa utilisasi GPU menentukan berhasil atau gagalnya ekonomi self-hosting?
- Karena GPU memakan biaya yang sama baik saat sibuk maupun menganggur. Pada utilisasi yang baik, biaya per juta token bisa turun di bawah satu dolar; pada beban rendah (misalnya 10%), biaya riil per token naik sekitar sepuluh kali lipat, yang sering membuat self-hosting lebih mahal daripada API premium. GPU yang menganggur adalah pemborosan murni — utilisasi adalah variabel tunggal terbesar.
- Apakah self-hosting lebih murah daripada API anggaran seperti model kecil yang di-host?
- Biasanya hanya pada volume yang sangat tinggi. API anggaran dihargai secara agresif, sehingga mengunggulinya dengan self-hosting biasanya membutuhkan puluhan hingga ratusan juta token per bulan pada utilisasi yang baik. Dibandingkan API premium, titik persilangannya datang jauh lebih cepat. Bandingkan dengan API spesifik yang akan Anda pakai, bukan tarif umum.
- Seberapa besar kuantisasi mengurangi biaya self-hosting?
- Secara signifikan. FP8 kira-kira menggandakan throughput dengan kerugian kualitas minimal, dan INT4 bisa kira-kira melipattigakannya sekaligus mengecilkan model agar muat di GPU yang lebih kecil dan lebih murah. Pada model besar, ini bisa memangkas biaya per juta token hingga setengah atau lebih — kuantisasi adalah salah satu tuas biaya dengan daya ungkit tertinggi untuk self-hosting.
- Apa saja biaya tersembunyi yang menyertai self-hosting LLM?
- Operasional. Di luar tagihan GPU, Anda membayar rekayasa MLOps (gaji enam digit), siklus pembaruan model (masing-masing berminggu-minggu kerja), serta server inferensi, pengelolaan driver, autoscaling, dan pemantauan. Ini secara rutin menambah biaya beberapa kali lipat dari biaya hardware mentah dan merupakan hal yang diabaikan oleh sebagian besar perhitungan titik impas yang naif.
- Bisakah saya menggabungkan self-hosting dan API untuk mengoptimalkan biaya?
- Bisa — hybrid biasanya merupakan pendekatan paling cerdas. Jalankan volume tinggi dan stabil pada inferensi lokal atau milik sendiri, beban kerja volume menengah yang dapat diprediksi pada endpoint khusus, dan trafik yang naik-turun tajam atau bervolume rendah (ditambah apa pun yang membutuhkan kualitas frontier) pada API bayar-per-token. Routing berdasarkan ekonomi menangkap penghematan self-hosting tanpa membayar GPU yang menganggur untuk pekerjaan yang bersifat bursty.
Sources