Gemini 3.6 Flash Google Pangkas Biaya Token AI Agent hingga 65 Persen

0 0
Read Time:2 Minute, 21 Second

Google DeepMind memperkenalkan tiga model AI baru yang dirancang untuk meningkatkan efisiensi penggunaan token pada agen AI. Model utama, Gemini 3.6 Flash, menawarkan harga API sebesar $1,50 per juta token input dan $7,50 per juta token output. Dua model pendukung, Gemini 3.5 Flash-Lite dan Gemini 3.5 Flash Cyber, melengkapi lini ini dengan fokus pada throughput tinggi serta aplikasi keamanan siber.

Gemini 3.5 Flash-Lite diposisikan sebagai opsi paling ekonomis dengan harga $0,30 per juta token input dan $2,50 per juta token output. Model ini dua kali lebih cepat dibanding pendahulunya, Gemini 3.1 Flash-Lite, meski harganya sedikit lebih tinggi. Perbandingan ini memberikan pilihan bagi perusahaan yang mengutamakan kecepatan tanpa mengorbankan efisiensi biaya secara keseluruhan.

Peningkatan efisiensi token pada Gemini 3.6 Flash mencapai 17 persen untuk output secara umum dan hingga 65 persen pada benchmark rekayasa perangkat lunak jangka panjang seperti DeepSWE. Pengurangan ini terjadi karena model memerlukan langkah penalaran dan pemanggilan alat yang lebih sedikit untuk menyelesaikan alur kerja multi-langkah yang sama. Hasilnya, biaya operasional agen AI turun signifikan saat menangani tugas kompleks.

Performa model juga meningkat pada beberapa tolok ukur. Gemini 3.6 Flash mencatat skor 49 persen di DeepSWE, naik dari 37 persen pada versi sebelumnya. Di MLE-Bench, skornya mencapai 63,9 persen, sementara OSWorld-Verified naik menjadi 83,0 persen. Peningkatan ini menunjukkan bahwa efisiensi token tidak mengorbankan kemampuan inti model dalam menangani tugas rekayasa dan multimodal.

Dari perspektif persaingan industri, langkah Google ini memperkuat posisi perusahaan dalam segmen agen AI yang membutuhkan operasi berkelanjutan. Banyak pengembang kini menghadapi tekanan biaya saat menjalankan agen otonom dalam skala besar, sehingga model dengan konsumsi token rendah menjadi daya tarik utama dibandingkan pendekatan yang hanya mengejar parameter lebih besar.

Selain itu, konteks window sebesar satu juta token pada model baru memungkinkan pemrosesan dokumen panjang atau kode kompleks tanpa fragmentasi berlebihan. Hal ini membuka peluang bagi tim pengembang untuk membangun sistem multi-agen yang lebih andal dengan biaya yang lebih terkendali, terutama di lingkungan enterprise yang sensitif terhadap pengeluaran komputasi.

Gemini 3.5 Flash Cyber ditujukan khusus untuk penelitian keamanan siber dan terintegrasi dengan agen CodeMender milik Google. Aksesnya dibatasi bagi pemerintah serta mitra terpercaya, mencerminkan kekhawatiran terhadap potensi penyalahgunaan model dalam domain siber. Model ini belum memiliki harga resmi yang diumumkan.

Google juga mengonfirmasi bahwa Gemini 3.5 Pro masih dalam tahap pengujian bersama mitra dan akan dirilis secara luas setelah siap. Sementara itu, lini Flash saat ini sudah tersedia melalui Gemini API di Google AI Studio dan Android Studio, serta dapat diakses dalam aplikasi konsumen Gemini dan Google Search.

Secara keseluruhan, rilis ini menandai fokus Google pada optimalisasi biaya dan kecepatan untuk kasus penggunaan agenik, bukan semata peningkatan skala model. Pengembang kini memiliki opsi lebih fleksibel untuk menyeimbangkan performa, latensi, dan anggaran saat membangun solusi AI jangka panjang.

Happy
0 0 %
Sad
0 0 %
Excited
0 0 %
Sleepy
0 0 %
Angry
0 0 %
Surprise
0 0 %

Related posts