Newtechclub.com – Tim Qwen dari raksasa teknologi China, Alibaba, baru saja meluncurkan senjata pamungkas mereka pada Minggu (29/3/2026). Namanya Qwen 3.5 Omni, dan percaya deh, ini bukan sekadar update biasa.
Para peneliti Alibaba benar-benar tidak main-main kali ini. Mereka menghadirkan lompatan teknologi paling ambisius dengan menciptakan AI “omnimodal” generasi terbaru. Apa maksudnya? AI ini bisa memproses berbagai jenis input secara BERSAMAAN! Mulai dari teks, gambar, audio, hingga video – semuanya dicerna dalam satu waktu tanpa perlu repot-repot gonta-ganti mode.
Fitur Kloning Suara: Bikin Geleng-Geleng Kepala!
Nah, yang paling bikin heboh, Qwen 3.5 Omni punya kemampuan voice cloning atau meniru suara pengguna dengan akurasi yang bikin merinding. Caranya gampang banget! Kamu cukup mengunggah sampel suaramu, lalu AI ini akan langsung berbicara menggunakan suara tersebut. Persis seperti aslimu!
Dengan fitur canggih ini, Alibaba secara terang-terangan menantang raja AI suara seperti ElevenLabs. Namun sayangnya, untuk saat ini kemampuan kloning suara baru bisa diakses melalui API. Tapi tenang, ini pertanda baik bahwa teknologi ini akan segera hadir untuk publik luas!
Interaksi Suara yang Makin Cerdas!
Tapi tunggu, masih ada lagi! Soal urusan suara, Qwen 3.5 Omni juga dibekali kecerdasan lain yang tak kalah keren. AI ini mampu berinteraksi secara real-time dalam percakapan suara langsung. Bayangkan betapa nyamannya ngobrol dengan AI yang benar-benar paham ritme bicara manusia!
Yang paling keren, model ini memiliki fitur “semantic interruption”. Apaan tuh? Fitur ini memungkinkan AI memahami kapan kamu benar-benar ingin menyela pembicaraan. Jadi, AI tidak akan langsung diam hanya karena mendengar suara latar atau respons singkat kayak “iya”, “eh”, atau “hmm”. Hasilnya? Percakapan terasa jauh lebih natural dan tidak kaku!
Teknologi ARIA: Akhirnya Suara dan Teks Selaras!
Tim pengembang Alibaba juga memperkenalkan teknologi anyar bernama ARIA (Adaptive Rate Interleave Alignment). Teknologi ini bekerja menyelaraskan teks dan suara secara dinamis. Pernah kesal denger AI salah ngucapin angka atau kata asing? Nah, ARIA hadir untuk mengatasi masalah itu!
Teknologi ini diklaim ampuh mengurangi kesalahan pengucapan, terutama pada angka-angka rumit atau kata-kata yang tidak umum dipakai sehari-hari. ARIA juga memungkinkan sinkronisasi dinamis antara teks dan suara sehingga hasil keluaran terdengar lebih natural dan akurat. Nggak ada lagi deh tuh AI ngomong kaku kayak robot!
Bisa Pahami Video dan Audio Sekaligus? Siapa Takut!
Berbeda dari kebanyakan model AI lain yang masih ngotot pakai teks sebagai perantara, Qwen 3.5 Omani melompat lebih jauh. AI ini mampu memproses teks, gambar, audio, dan video secara native alias langsung dalam satu sistem terpadu. Keren banget kan?
Pendekatan revolusioner ini membuat pemrosesan jadi lebih cepat dan hasilnya lebih konsisten. Nggak kayak metode multimodal yang menggabungkan beberapa model terpisah seperti yang dilakukan ChatGPT. Jadi ya jelas lebih efisien!
Untuk mencapai kemampuan segila ini, Qwen 3.5 Omni dilatih dengan lebih dari 100 juta jam data audio-visual. Coba bayangkan skala pelatihannya! Jumlah yang sangat fantastis ini membuat kemampuan AI ini berada di kelas yang benar-benar berbeda dari para pesaingnya.
Mau bukti? Coba simak hasil uji coba berikut. Qwen 3.5 Omni dibandingkan langsung dengan ChatGPT 5.4 (mode thinking) menggunakan video YouTube Short yang sama. Hasilnya? Qwen 3.5 Omni mampu memproses video tersebut secara langsung dan memberikan analisis lengkap dalam waktu sekitar satu menit! Analisisnya mencakup siapa yang berbicara, topik pembahasan, hingga komentar berdasarkan konteks. Giliran ChatGPT 5.4? Waduh, dia harus melalui beberapa tahapan terpisah: ekstrak frame video, proses dengan model visi, transkripsi audio pakai Whisper, plus baca subtitle dengan OCR. Total waktu yang dibutuhkan sekitar sembilan menit! Bahkan dalam kondisi ideal sekalipun, ChatGPT kalah cepat.
Dukung 113 Bahasa! Dunia Jadi Kampung Sendiri
Yang juga bikin melongo, Qwen 3.5 Omni mendukung interasi dalam berbagai bahasa. Model canggih ini mampu memahami hingga 113 bahasa dan dialek untuk pengenalan suara. Wow! Angka ini melonjak drastis dari generasi sebelumnya yang hanya mendukung 19 bahasa.
Dalam pengujian lapangan, AI ini tercatat mampu menangani percakapan dalam berbagai bahasa seperti Spanyol, Portugis, dan Inggris dengan mulus. Yang lebih keren lagi, model AI ini bisa berpindah bahasa di tengah-tengah percakapan tanpa kehilangan konteks sama sekali. Bayangkan ngobrol campur-campur bahasa dan AI tetap paham!
Bahkan dalam benchmark stabilitas suara multibahasa, Qwen 3.5 Omni Plus berhasil mengungguli ElevenLabs, GPT-Audio, dan Minimax di 20 bahasa berbeda. Kemenangan telak!
Performa Meningkat Drastis, Bisa Bikin Kode dari Rekaman Video!
Sebagai informasi tambahan, Qwen 3.5 Omni tersedia dalam tiga varian menarik: Plus, Flash, dan Light. Ketiganya dibekali context window hingga 256.000 token. Artinya, AI ini bisa mengingat percakapan super panjang!
Pada pengujian benchmark, varian Qwen 3.5 Omni Plus dilaporkan mampu mengungguli model AI buatan Google, Gemini 3.1 Pro dalam sejumlah aspek penting. Mulai dari pemahaman audio, penalaran, terjemahan, hingga setara dalam pemahaman audio-visual. Google harus kerja ekstra keras buat mengejar ketertinggalannya!
Fitur pamungkas lainnya adalah Audio-Visual Vibe Coding. Apa lagi ini? Fitur keren ini memungkinkan AI untuk menonton video atau rekaman layar dari proses coding, lalu menghasilkan kode yang berfungsi dengan sempurna – tanpa perlu instruksi teks sama sekali! Bayangkan kamu tinggal record coding-mu, dan AI langsung paham serta menghasilkan kode yang kamu butuhkan.
Kemampuan canggih ini menjadi gambaran nyata bagaimana asisten AI di masa depan dapat bekerja langsung di dalam alur kerja pengguna, bukan hanya sekadar alat pendamping. Masa depan sudah tiba, guys!
Akses Mudah untuk Semua
Kabar baiknya, Qwen 3.5 Omni saat ini sudah tersedia melalui API Alibaba Cloud. Model ini juga bisa diuji coba langsung melalui layanan Qwen Chat maupun demo online di platform Hugging Face. Jadi tunggu apa lagi? Segera cobain sendiri kecanggihan AI yang bisa meniru suaramu ini!
Temukan juga berbagai berita terbaru lainnya hanya di Exposenews.id.

