| Tweet |
|
Topik:
|
AI System: Analogi Manusia (LLM, RAG, Agen AI, dan MCP Dijelaskan Secara Sederhana)Oleh: Hobon.id (05/10/2026)
Artificial intelligence telah berkembang lebih cepat dalam beberapa tahun terakhir daripada kemampuan kebanyakan orang untuk memahaminya. Terminologinya saja—large language model, retrieval-augmented generation, AI agen, model context protocol—dapat terasa seperti tembok jargon yang dirancang untuk menjauhkan non-spesialis. Namun, konsep-konsep yang mendasarinya, begitu kita memahaminya dengan jelas, sama sekali tidak misterius. Bahkan, sistem AI paling canggih yang dibangun saat ini dimodelkan berdasarkan sesuatu yang sudah kita pahami secara intuitif, yaitu seperti cara manusia berpikir, mengingat, bertindak, dan terhubung dengan dunia.Di sini, kami akan menjelaskan empat blok bangunan dasar sistem AI modern menggunakan analogi manusia tunggal dan koheren yang membuat setiap konsep mudah dipahami. LLM adalah otak—pusat bahasa, penalaran, dan pengetahuan. RAG adalah otak yang dikombinasikan dengan buku—memberi otak akses ke informasi spesifik dan terkini yang tidak dihafalnya. Agen AI adalah otak yang dikombinasikan dengan tangan—memberi otak kemampuan untuk bertindak, bukan hanya berpikir. Dan MCP, Model Context Protocol, adalah lapisan penghubung — sistem saraf yang memungkinkan otak berkomunikasi secara lancar dengan segala sesuatu di sekitarnya. Advertisement:
Mengapa Analogi Penting dalam Memahami AISebelum mengeksplorasi setiap analogi secara mendalam, ada baiknya bertanya mengapa menggunakan analogi untuk menjelaskan AI tidak hanya nyaman secara pedagogis tetapi juga benar-benar akurat. Jawabannya adalah bahwa sistem AI modern, sampai batas tertentu yang mengejutkan, dirancang dengan mengacu pada model kognisi manusia. Arsitektur transformer yang mendukung hampir setiap model bahasa besar saat ini terinspirasi, setidaknya sebagian, oleh penelitian tentang bagaimana otak manusia mengalokasikan perhatian. Konsep agen AI yang merencanakan dan bertindak di dunia nyata berasal langsung dari penelitian ilmu kognitif selama beberapa dekade tentang bagaimana manusia mengejar tujuan. RAG pada dasarnya adalah formalisasi dari apa yang dilakukan oleh setiap peneliti yang baik — berkonsultasi dengan sumber eksternal untuk melengkapi apa yang sudah mereka ketahui. Analogi yang dijelaskan di sini bukanlah sekadar penyederhanaan yang dirancang untuk membuat topik yang kompleks menjadi mudah dipahami. Analogi tersebut merupakan refleksi dari paralel struktural yang nyata antara cara kerja sistem AI ini dan cara kerja kecerdasan manusia. Di mana analogi tersebut gagal — dan setiap analogi pada akhirnya akan gagal — kita akan mencatatnya, karena kegagalan tersebut seringkali merupakan tempat detail teknologi yang paling menarik dan penting berada. Keempat blok bangunan yang dijelaskan di sini dapat dikombinasikan dengan berbagai cara, tetapi perkembangan dari satu ke yang berikutnya mengikuti logika alami: masing-masing menambahkan kemampuan baru ke yang sebelumnya. LLM saja dapat berpikir. Tambahkan RAG dan ia dapat mengingat hal-hal spesifik. Tambahkan arsitektur agen dan ia dapat bertindak. Tambahkan MCP dan ia dapat terhubung dan berinteraksi dengan kompleksitas penuh dunia digital. Bersama-sama, keempat komponen ini menggambarkan arsitektur sistem AI paling mumpuni yang sedang dibangun saat ini. LLM: OtakApa Sebenarnya Large Language Model ItuPada intinya, large language model adalah fungsi matematika yang dilatih pada sejumlah besar teks. Selama pelatihan, model tersebut dihadapkan pada ratusan miliar kata — buku, artikel, website, repositori kode, makalah ilmiah, percakapan — dan belajar untuk memprediksi kata atau token apa yang paling mungkin mengikuti urutan kata tertentu. Melalui proses ini, model mengembangkan sesuatu yang jauh lebih menarik daripada fitur pelengkapan otomatis yang canggih, yaitu ia mengembangkan representasi internal yang kaya tentang bahasa, konsep, hubungan, fakta, pola penalaran, dan model dunia. Hasilnya adalah sistem yang, ketika diberi urutan teks sebagai masukan, dapat menghasilkan kelanjutan teks yang relevan, koheren, dan sesuai konteks. Ajukan pertanyaan dan ia akan menghasilkan jawaban. Berikan masalah dan ia akan menyelesaikannya. Berikan instruksi dan ia akan mengeksekusinya. Kecerdasan yang tampak muncul bukan dari pemrograman aturan atau pengetahuan eksplisit apa pun, tetapi dari keteraturan statistik yang dipelajari di seluruh kumpulan teks yang dihasilkan manusia yang sangat besar. Inilah otak. Tentu saja, ini bukan otak biologis secara harfiah — tetapi sebuah sistem yang menjalankan fungsi kognitif inti yang kita kaitkan dengan kecerdasan manusia, yaitu seperti memahami bahasa, memanfaatkan pengetahuan yang diingat, bernalar tentang masalah, menghasilkan keluaran baru, dan berkomunikasi dalam bahasa alami. Mengapa "Otak" Adalah Analogi yang TepatOtak manusia adalah pusat dari segala sesuatu yang kita anggap sebagai perilaku cerdas. Otak menyimpan pengetahuan yang terakumulasi sepanjang hidup, bernalar melalui masalah, menghasilkan bahasa, memahami konteks, membuat analogi, dan menghasilkan respons terhadap dunia di sekitarnya. Ketika kita mengajukan pertanyaan kepada teman yang berpengetahuan, otaknya mencari representasi internalnya — segala sesuatu yang telah dipelajari, dibaca, dialami, dan dipikirkan — dan menghasilkan jawaban. Sebuah LLM melakukan sesuatu yang secara struktural serupa. "Pengetahuannya" didistribusikan di seluruh miliaran parameter numerik — bobot jaringan saraf — dengan cara yang tidak secara langsung analog dengan bagaimana ingatan disimpan dalam otak biologis tetapi memiliki tujuan fungsional yang sama. Ketika kita memberikan masukan ke LLM, komputasi yang menghasilkan respons memanfaatkan pola yang didistribusikan di seluruh parameter tersebut, sama seperti menjawab pertanyaan memanfaatkan pengetahuan yang didistribusikan di seluruh koneksi saraf otak manusia. Seperti otak manusia, LLM bersifat umum. Otak yang sama yang menulis puisi juga memecahkan masalah matematika, merencanakan perjalanan, dan mendiagnosis penyakit. LLM yang sama yang menghasilkan teks pemasaran juga menulis kode, menganalisis laporan keuangan, menerjemahkan bahasa, dan meringkas dokumen hukum. Generalitas ini — kemampuan untuk menerapkan kecerdasan secara fleksibel di berbagai tugas yang tak terbatas — adalah apa yang membuat LLM sangat berbeda dari sistem AI sempit yang mendahuluinya, dan inilah yang paling tepat digambarkan oleh analogi otak. Keterbatasan Otak: Apa yang Tidak Dapat Dilakukan LLM SendirianKeterbatasan terpenting adalah batas pengetahuan. Otak yang dilatih dengan data hingga tanggal tertentu tidak mengetahui apa yang terjadi setelah tanggal tersebut. LLM yang dilatih hingga tahun 2025 tidak mengetahui peristiwa di tahun 2026. Sama seperti seseorang yang telah koma selama setahun bangun tanpa mengetahui apa yang telah terjadi saat mereka tidak sadarkan diri, pengetahuan internal LLM dibekukan pada saat pelatihan berakhir. Keterbatasan kedua adalah bahwa pengetahuan internal otak bersifat umum, bukan spesifik. LLM yang dilatih di internet memiliki pengetahuan dunia yang luas, tetapi tidak memiliki pengetahuan spesifik tentang dokumen internal organisasi kita, codebase kita, data pelanggan kita, atau pengetahuan domain spesifik yang terkandung dalam sumber daya milik perusahaan. Sama seperti seorang generalis brilian tidak secara otomatis mengetahui detail spesifik sejarah perusahaan kita atau peraturan industri kita, pelatihan seorang LLM tidak mencakup informasi yang bersifat pribadi atau yang baru dibuat. Keterbatasan ketiga adalah bahwa otak, secara terisolasi, hanya dapat berpikir. Ia tidak dapat bertindak. Seseorang yang tahu cara memesan penerbangan tetapi tidak memiliki tangan, telepon, komputer, dan cara untuk berinteraksi dengan dunia tidak dapat benar-benar memesan penerbangan. Pengetahuan mereka bersifat inert. Demikian pula, seorang LLM yang dapat bernalar tentang tindakan apa yang harus diambil tidak dapat mengambil tindakan apa pun tanpa mekanisme yang menerjemahkan penalaran tersebut ke dalam operasi dunia nyata. Keterbatasan keempat adalah bahwa otak tidak dapat berkomunikasi langsung dengan sistem eksternal. Seseorang yang mengetahui segala sesuatu tentang spreadsheet tetap tidak dapat memodifikasi spreadsheet kecuali mereka memiliki akses ke aplikasi spreadsheet dan kemampuan untuk berinteraksi dengannya. Seorang LLM tidak dapat membaca email kita, memperbarui kalender kita, menanyakan database, atau memanggil API tanpa infrastruktur integrasi khusus. Keempat keterbatasan ini justru merupakan hal yang ingin diatasi oleh RAG, agen AI, dan MCP — dan memahaminya sebagai keterbatasan otak yang beroperasi sendiri membuat tujuan dari setiap sistem tambahan menjadi sangat jelas. RAG: Otak Plus BukuApa Sebenarnya Retrieval-Augmented GenerationRetrieval-Augmented Generation — RAG — adalah pola desain sistem yang meningkatkan LLM (Large Language Model) dengan memberikannya akses ke basis pengetahuan eksternal yang dapat diaksesnya pada saat inferensi. Alih-alih hanya mengandalkan pengetahuan yang dikodekan dalam parameternya selama pelatihan, sistem RAG dapat mengambil dokumen, bagian, atau data yang relevan dari penyimpanan eksternal dan menggabungkan informasi yang diambil tersebut ke dalam konteks yang digunakannya untuk menghasilkan responsnya. Mekanisme ini bekerja dalam dua fase. Pada fase pengambilan, kueri pengguna digunakan untuk mencari basis pengetahuan — kumpulan dokumen, catatan database, halaman web, atau informasi berbasis teks lainnya. Pencarian ini biasanya bersifat semantik daripada berbasis kata kunci, yaitu kueri diubah menjadi vektor numerik (embedding) yang mewakili maknanya, dan basis pengetahuan dicari untuk dokumen yang embedding-nya paling mirip dengan embedding kueri, artinya dokumen tersebut paling relevan secara semantik dengan apa yang ditanyakan pengguna. Pada fase pembangkitan, dokumen yang diambil diberikan kepada LLM bersamaan dengan kueri asli sebagai konteks tambahan, dan LLM menghasilkan respons yang dapat memanfaatkan baik pengetahuan yang telah dilatihnya maupun informasi yang diambil secara spesifik. Mengapa "Otak Plus Buku" Adalah Analogi yang TepatBayangkan seorang profesor yang ahli di bidangnya. Ia telah menghabiskan puluhan tahun belajar dan mengajar, dan otaknya dipenuhi dengan konsep, kerangka kerja, dan pengetahuan yang telah ia kumpulkan sepanjang hidupnya. Ketika seorang mahasiswa mengajukan pertanyaan kepadanya, ia menggunakan pengetahuan internal tersebut untuk menjawabnya. Sekarang bayangkan profesor yang sama ditanya pertanyaan yang sangat spesifik, misalnya seperti persyaratan peraturan yang tepat di yurisdiksi tertentu, hasil pasti dari uji klinis tertentu yang diterbitkan bulan lalu, ketentuan spesifik dalam kontrak yang belum pernah ia baca. Tidak ada otak, betapapun terlatihnya, yang dapat menghafal semuanya. Untuk informasi spesifik, terkini, atau rahasia, bahkan orang yang paling ahli pun bergantung pada buku, makalah, database, dan dokumen — penyimpanan pengetahuan eksternal yang melengkapi memori internal mereka. Ketika profesor mengambil buku teks dari raknya, menemukan bagian yang relevan, membacanya, dan memasukkan informasi tersebut ke dalam jawabannya, ia melakukan apa yang dilakukan sistem RAG. Buku tersebut adalah basis pengetahuan eksternal. Tindakan menemukan bagian yang relevan adalah fase pengambilan. Menggabungkan apa yang telah dibacanya ke dalam jawaban yang koheren adalah fase pembangkitan. Hasilnya adalah jawaban yang menggabungkan kecerdasan umum dan kemampuan penalaran profesor (LLM) dengan informasi spesifik yang diperolehnya dari sumber yang relevan (basis pengetahuan eksternal). Inilah mengapa RAG ada: ia mengatasi dua keterbatasan praktis otak yang paling kritis — yaitu keterbatasan pengetahuan dan kurangnya informasi spesifik atau pribadi — dengan memberikan akses kepada otak ke sumber eksternal yang dapat diperbarui, diperluas, dan disesuaikan tanpa melatih ulang otak itu sendiri. Bagaimana RAG Memecahkan Masalah Batasan PengetahuanKonsekuensi praktis terpenting dari batasan pengetahuan adalah bahwa LLM (Large Language Model) yang berdiri sendiri tidak dapat memberikan informasi akurat tentang peristiwa terkini. Tanyakan pada LLM apa yang terjadi di berita hari ini, dan ia tidak dapat mengetahuinya. Tanyakan tentang produk yang dirilis bulan lalu, dan ia tidak memiliki informasi. Tanyakan tentang perubahan peraturan yang diumumkan pada kuartal ini, dan ia akan mengatakan bahwa ia tidak tahu atau, lebih buruk lagi, mengarang jawaban yang terdengar masuk akal tetapi salah. Sistem RAG yang terhubung ke basis pengetahuan waktu nyata atau yang diperbarui secara berkala menyelesaikan masalah ini sepenuhnya. Alih-alih mengandalkan pengetahuan internal LLM yang beku, sistem mengambil informasi terbaru dari penyimpanan eksternal sebelum menghasilkan respons. Kecerdasan penalaran LLM tetap tidak berubah; sekarang ia hanya memiliki akses ke informasi terkini sebagai konteks. Ini analog dengan perbedaan antara meminta teman profesor kita untuk menjawab pertanyaan tentang peristiwa terkini dari ingatan versus memberinya koran hari ini sebelum dia menjawab. Kecerdasannya — kemampuannya untuk memahami, mensintesis, dan menjelaskan — sama dalam kedua kasus tersebut. Kualitas jawabannya meningkat drastis ketika dia memiliki akses ke informasi terkini. Bagaimana RAG Memungkinkan Pengetahuan Pribadi dan RahasiaMasalah kritis kedua yang dipecahkan RAG adalah kesenjangan antara pengetahuan LLM yang dilatih secara publik dan informasi spesifik, pribadi, atau rahasia yang dibutuhkan organisasi agar sistem AI-nya dapat memahaminya. LLM yang dilatih di internet publik tidak memiliki pengetahuan tentang proses internal perusahaan kita, dokumentasi produk kita, riwayat interaksi pelanggan kita, kontrak hukum kita, atau rencana strategis kita. Semua ini hanya ada dalam sistem informasi pribadi organisasi kita. Agar asisten AI benar-benar bermanfaat dalam suatu organisasi, ia perlu dapat menjawab pertanyaan tentang domain pengetahuan pribadi ini — bukan hanya tentang pengetahuan umum dunia. RAG memungkinkan hal ini dengan memungkinkan organisasi untuk membangun basis pengetahuan khusus dari dokumen dan data mereka sendiri, menghubungkan basis pengetahuan tersebut ke LLM, dan menciptakan sistem AI yang menggabungkan kecerdasan bahasa dari model terdepan dengan pengetahuan yang mendalam dan akurat tentang konteks spesifik organisasi. Seorang karyawan dapat bertanya, "Apa kebijakan perusahaan kita tentang penggantian biaya perjalanan internasional?" Sistem RAG mengambil bagian yang relevan dari dokumen kebijakan SDM dan menghasilkan jawaban yang akurat dan spesifik — tanpa kebijakan tersebut pernah ada dalam data pelatihan LLM. Analogi profesor ini dapat diperluas secara alami: sama seperti seorang profesor dapat berkonsultasi dengan buku panduan fakultas perusahaan tempatnya bekerja untuk mendapatkan informasi spesifik institusi yang tidak pernah menjadi bagian dari pendidikan pascasarjananya, seorang LLM yang ditingkatkan dengan RAG dapat berkonsultasi dengan basis pengetahuan internal organisasi untuk mendapatkan informasi yang tidak pernah menjadi bagian dari pelatihannya. Pentingnya Landasan dan KutipanSalah satu manfaat praktis terpenting dari RAG, di luar akses informasi yang diberikannya, adalah landasan yang ditawarkannya untuk mencegah halusinasi. Sebuah LLM (Large Language Model) yang berdiri sendiri, ketika ditanya tentang sesuatu yang tidak diketahuinya secara pasti, dapat menghasilkan jawaban yang terdengar percaya diri tetapi secara faktual salah. Inilah masalah halusinasi — dan ini adalah salah satu tantangan paling signifikan dalam menerapkan LLM dalam konteks di mana akurasi sangat penting. Sistem RAG yang dirancang dengan baik mengurangi masalah ini dengan menghasilkan respons berdasarkan dokumen yang ditemukan dan menyertakan kutipan ke dokumen tersebut dalam respons. Jika jawabannya ada dalam konteks yang ditemukan, LLM dapat menghasilkannya secara akurat. Jika jawabannya tidak ada dalam konteks yang ditemukan, sistem yang dirancang dengan benar dapat diinstruksikan untuk mengakui bahwa informasi tersebut tidak ditemukan daripada mengarang jawaban. Landasan ini setara dengan seorang profesor yang mengatakan "menurut penelitian ini, temuannya adalah X" daripada berbicara berdasarkan ingatan yang tidak pasti. Pencantuman sumber referensi menciptakan akuntabilitas, memungkinkan verifikasi, dan membuat hasil akhir lebih dapat dipercaya — yang sangat penting untuk aplikasi berisiko tinggi di bidang kedokteran, hukum, keuangan, dan pengambilan keputusan organisasi. Agen AI: Otak Plus TanganApa Sebenarnya Agen AI ItuAgen AI adalah sistem di mana large language model diberi kemampuan untuk melakukan tindakan di dunia nyata — bukan hanya menghasilkan teks, tetapi menggunakan alat yang berinteraksi dengan sistem eksternal, mengeksekusi kode, menjelajahi web, mengirim pesan, memanggil API, membaca dan menulis file, dan melakukan operasi lain apa pun yang dapat diekspresikan sebagai fungsi yang dapat dipanggil oleh model. LLM berfungsi sebagai mesin kognitif agen: ia merencanakan apa yang harus dilakukan, memutuskan alat mana yang akan digunakan, menafsirkan hasil penggunaan alat, dan terus bekerja menuju tujuannya hingga tugas selesai. Pola arsitektur yang mendasari sebagian besar agen AI modern adalah siklus penalaran, yaitu model memikirkan keadaan tugas saat ini, memutuskan tindakan apa yang akan diambil selanjutnya, mengambil tindakan itu melalui panggilan alat, mengamati hasilnya, menalar tentang arti hasil tersebut, memutuskan apa yang harus dilakukan selanjutnya, dan melanjutkan siklus ini hingga menentukan bahwa tugas telah selesai atau tidak dapat dilanjutkan tanpa masukan manusia. Siklus ini dapat berulang berkali-kali untuk tugas-tugas kompleks — agen riset mungkin melakukan puluhan panggilan alat di berbagai mesin pencari, database, dan dokumen sebelum mengumpulkan informasi yang cukup untuk menghasilkan keluaran akhirnya. Mengapa "Otak Plus Tangan" Adalah Analogi yang TepatKecerdasan tanpa kemampuan untuk bertindak pada akhirnya terbatas kegunaannya. Seseorang yang tahu segalanya tentang memasak tetapi tidak dapat menggerakkan tangannya tidak dapat menyiapkan makanan. Seseorang yang memahami pasar saham sepenuhnya tetapi tidak dapat melakukan perdagangan tidak dapat memperoleh keuntungan dari pemahaman tersebut. Seseorang yang dapat menulis dengan sempurna tetapi tidak memiliki cara untuk mengirimkan tulisannya tidak dapat berkomunikasi dengan siapa pun. Tangan — dan secara lebih luas, kemampuan untuk melakukan tindakan fisik dan operasional di dunia — adalah apa yang mengubah pengetahuan dan penalaran dari sesuatu yang internal dan inert menjadi sesuatu yang mengubah realitas eksternal. Tangan menerima arahan dari otak. Mereka menjalankan instruksi. Mereka berinteraksi dengan objek dan sistem. Mereka menerima umpan balik melalui indera, yang diproses oleh otak dan digunakan untuk menyesuaikan tindakan selanjutnya. Agen AI bekerja dengan cara yang sama. LLM (otak) mengarahkan alat (tangan). Alat-alat tersebut menjalankan operasi di dunia — mencari di internet, menjalankan kode, memperbarui database, mengirim permintaan API. Hasil dari operasi tersebut dikembalikan ke LLM sebagai umpan balik, yang digunakannya untuk memutuskan apa yang harus dilakukan selanjutnya. Siklus perencanaan, tindakan, pengamatan, dan perencanaan ulang merupakan analog komputasi langsung dari siklus sensorimotor yang digunakan manusia untuk berinteraksi dengan lingkungannya. "Tangan" dalam arsitektur agen AI dapat berupa alat apa pun yang telah diberikan aksesnya kepada sistem. Tergantung pada implementasinya, alat-alat tersebut mungkin termasuk fungsi pencarian web, lingkungan eksekusi kode, sistem file, klien email, kalender, antarmuka kueri database, alat otomatisasi browser, model pembuatan gambar, atau kemampuan lain apa pun yang telah dibungkus ke dalam fungsi yang dapat dipanggil. Jangkauan kemampuan agen sepenuhnya ditentukan oleh alat-alat yang telah diberikan aksesnya — sama seperti kemampuan seseorang untuk berinteraksi dengan dunia fisik ditentukan oleh alat dan kemampuan fisik yang tersedia bagi mereka. Perencanaan, Aksi, dan Siklus Umpan BalikSalah satu konsep terpenting dalam memahami agen AI adalah perbedaan antara agen yang bertindak segera dan agen yang merencanakan sebelum bertindak. Agen AI yang paling mumpuni melakukan perencanaan multi-langkah secara eksplisit sebelum mengambil tindakan apa pun — menguraikan tujuan yang kompleks menjadi serangkaian sub-tugas, mempertimbangkan ketergantungan antar sub-tugas tersebut, dan kemudian mengeksekusinya dalam urutan yang tepat. Pertimbangkan perbedaan antara meminta seseorang "pesankan saya penerbangan ke Tokyo untuk Selasa depan" dan benar-benar memesan penerbangan tersebut. Memesan penerbangan membutuhkan serangkaian tindakan, yaitu seperti menentukan kota keberangkatan, mencari penerbangan yang tersedia, membandingkan pilihan berdasarkan kriteria seperti harga dan durasi, memilih pilihan terbaik, memasukkan informasi penumpang, memberikan pembayaran, dan mengkonfirmasi pemesanan. Setiap tindakan bergantung pada hasil dari tindakan sebelumnya. Perencanaan tersebut tidak terlihat oleh orang yang membuat permintaan — mereka hanya melihat hasil akhirnya — tetapi sangat penting untuk menghasilkan hasil tersebut. Agen AI yang bertugas memesan penerbangan melakukan urutan yang sama. LLM merencanakan langkah-langkah, menggunakan alat browser-nnya untuk menavigasi ke mesin pencari penerbangan, menginterpretasikan hasil pencarian, menggunakan panggilan alat lebih lanjut untuk membandingkan opsi, membuat pilihan, dan menyelesaikan alur kerja pemesanan. Pada setiap langkah, hasil dari tindakan sebelumnya menginformasikan keputusan selanjutnya. Agen dapat menangani situasi yang tidak terduga — penerbangan yang sudah terjual habis, formulir yang membutuhkan bidang yang tidak diharapkan agen — dengan mempertimbangkan informasi baru dan menyesuaikan rencananya. Kemampuan untuk beradaptasi dengan hasil yang tidak terduga ini adalah salah satu sifat terpenting dari agen AI yang dirancang dengan baik, dan merupakan salah satu cara analogi otak-plus-tangan paling akurat mencerminkan realitas. Tangan manusia tidak beroperasi dalam urutan yang kaku dan telah diprogram sebelumnya. Mereka merespons umpan balik — jika pintu tidak terbuka saat kita mendorong, kita mencoba menariknya. Agen AI melakukan hal yang sama: ketika panggilan alat menghasilkan hasil yang tidak terduga, LLM mempertimbangkan apa yang harus dilakukan secara berbeda dan menyesuaikan tindakan selanjutnya. Sistem Multi-Agen: Banyak Otak, Banyak TanganArsitektur agen secara alami meluas ke sistem multi-agen, di mana banyak agen yang didukung LLM bekerja bersama, masing-masing dengan peran dan perangkat khusus, dikoordinasikan untuk menyelesaikan tugas-tugas yang lebih kompleks daripada yang dapat ditangani oleh satu agen saja. Sistem multi-agen pengembangan software mungkin mencakup agen yang merencanakan fitur, agen yang menulis kode, agen yang menulis pengujian, agen yang meninjau kualitas kode, dan agen pengatur yang mengkoordinasikan alur kerja di antara semuanya. Menggunakan analogi manusia, ini tidak berbeda dengan cara kerja tim manusia. Sebuah proyek kompleks tidak memiliki satu orang yang melakukan segalanya — proyek tersebut memiliki spesialis yang masing-masing menyumbangkan kemampuan khusus mereka, dikoordinasikan oleh manajer proyek atau sistem alur kerja yang memastikan hasil mereka digabungkan dengan benar. Sistem multi-agen adalah versi AI dari prinsip organisasi yang sama, yaitu kecerdasan terdistribusi dan khusus yang dikoordinasikan menuju tujuan bersama. Pentingnya PengawasanSifat-sifat yang membuat agen AI menjadi kuat—otonomi, kemampuan untuk mengambil tindakan dengan konsekuensi nyata, kapasitas untuk beroperasi di banyak tahapan tanpa campur tangan manusia—juga menjadikannya kategori sistem AI yang membutuhkan pertimbangan paling cermat tentang pengawasan dan keamanan. Ketika LLM menghasilkan teks, hal terburuk yang dapat dilakukannya adalah menghasilkan output yang tidak membantu atau salah yang dapat dengan mudah dibuang oleh manusia. Ketika agen AI mengirim email, memodifikasi file, menjalankan kode, atau berinteraksi dengan layanan eksternal, tindakannya memiliki konsekuensi yang mungkin sulit atau tidak mungkin untuk dibatalkan. Agen yang salah memahami instruksi dan mengirim draf email ke seluruh daftar pelanggan alih-alih ke satu orang telah menyebabkan kerugian nyata. Agen yang menghapus file yang salah telah menyebabkan kehilangan data nyata. Sistem agen yang dirancang dengan baik mengatasi hal ini dengan membedakan antara tindakan yang dapat dibatalkan dan yang tidak dapat dibatalkan, mensyaratkan persetujuan manusia sebelum mengambil tindakan dengan konsekuensi tinggi, memberikan visibilitas yang jelas tentang apa yang dilakukan agen dan mengapa, dan menawarkan mekanisme untuk menghentikan, membatalkan, atau mengesampingkan perilaku agen. Analogi otak plus tangan juga relevan di sini: sama seperti kita memberikan pengawasan lebih dan tanggung jawab yang lebih kecil kepada anak-anak dan karyawan baru sementara mereka membangun rekam jejak penilaian yang baik, agen AI harus dikerahkan dengan pengawasan yang proporsional dengan konsekuensi dari kemungkinan kesalahan mereka. MCP: Lapisan KoneksiApa Sebenarnya Model Context Protocol ItuModel Context Protocol (MCP) adalah standar terbuka — yang diterbitkan oleh Anthropic pada November 2024 dan diadopsi dengan cepat di seluruh industri AI — yang mendefinisikan bagaimana model AI berkomunikasi dengan alat eksternal, sumber data, dan layanan. MCP menetapkan antarmuka universal yang dapat digunakan oleh model AI apa pun untuk terhubung ke server yang kompatibel dengan MCP, terlepas dari apa yang dilakukan server tersebut atau perusahaan mana yang membangunnya. Sebelum MCP, menghubungkan model AI ke sistem eksternal merupakan upaya rekayasa khusus. Setiap integrasi antara model dan alat membutuhkan kode khusus di kedua sisi — model membutuhkan kode khusus untuk memformat permintaannya untuk alat tersebut, dan alat tersebut membutuhkan kode khusus untuk menerima permintaan dari model tersebut. Jika kita ingin sistem AI kita bekerja dengan sepuluh alat yang berbeda, kita membutuhkan sepuluh integrasi khusus yang berbeda. Jika alat-alat tersebut merilis API yang diperbarui, kita perlu memperbarui semua integrasi tersebut. Dan jika kita ingin menggunakan model AI yang berbeda, kita mungkin perlu membangun kembali semua integrasi tersebut dari awal untuk antarmuka model baru. MCP mengatasi hal ini dengan menyediakan protokol tunggal dan terstandarisasi yang digunakan oleh semua pihak. Model AI yang mengimplementasikan MCP dapat terhubung ke server MCP mana pun. Aplikasi yang mengekspos antarmuka server MCP dapat digunakan oleh model AI yang kompatibel dengan MCP mana pun. Hasilnya adalah adaptor universal — analog dengan USB atau Bluetooth — yang membuat model AI dan alat eksternal dapat beroperasi bersama tanpa rekayasa khusus untuk setiap kombinasi. Mengapa "Lapisan Koneksi" Adalah Analogi yang TepatSetiap manusia adalah pusat dari jaringan koneksi yang rumit. Sistem saraf kita menghubungkan otak kita ke tangan dan bagian tubuh kita lainnya. Indra kita menghubungkan otak kita ke lingkungan fisik kita. Kemampuan bahasa dan komunikasi kita menghubungkan kita dengan orang lain. Kemampuan kita untuk menggunakan alat dan perangkat menghubungkan kita dengan teknologi. Tanpa koneksi ini, kemampuan otak kita menjadi tidak aktif — semua kecerdasan dan pengetahuan itu tidak memiliki saluran untuk berinteraksi dengan dunia atau mengumpulkan informasi baru. Sistem saraf adalah lapisan koneksi dasar tubuh manusia. Ini adalah infrastruktur yang memungkinkan keputusan otak menjadi tindakan tangan, yang memungkinkan masukan mata menjadi persepsi visual otak, yang memungkinkan suara untuk menyampaikan pikiran otak kepada orang lain. Ini bukanlah sumber kecerdasan itu sendiri — itu adalah otak. Ini bukanlah sistem pengetahuan — itu adalah memori dan pembelajaran. Ini bukanlah kemampuan untuk bertindak — itu adalah otot dan sistem motorik tubuh. Ini adalah infrastruktur komunikasi yang membuat semua hal itu bekerja bersama. MCP memainkan peran yang sama dalam arsitektur sistem AI. Ini bukan kecerdasan (itu adalah LLM). Ini bukan sistem pengambilan pengetahuan (itu adalah RAG). Ini bukan kemampuan bertindak (itu adalah arsitektur agen). Ini adalah protokol komunikasi yang memungkinkan LLM untuk terhubung secara lancar dengan alat, sumber data, dan layanan — infrastruktur tempat semua komponen lain bekerja bersama. Bagaimana MCP Bekerja dalam PraktikArsitektur MCP memiliki dua sisi, yaitu model (klien) dan sistem eksternal (server). Server MCP dibangun oleh penyedia layanan eksternal — sistem file, database, browser web, klien email, kalender, alat desain, lingkungan eksekusi kode, atau sistem lainnya. Server MCP mengekspos kemampuan sistem tersebut dalam format standar yang menjelaskan apa yang dapat dilakukan server (alatnya), data apa yang dapat diberikannya (sumber dayanya), dan alur kerja yang telah ditentukan sebelumnya yang didukungnya (perintahnya). Ketika model AI perlu menggunakan sistem eksternal, ia berkomunikasi dengan server MCP melalui protokol standar. Ia dapat meminta daftar alat yang tersedia, memanggil alat tertentu dengan parameter tertentu, meminta akses ke sumber daya tertentu, dan menerima hasilnya — semuanya melalui antarmuka protokol yang sama, terlepas dari sistem yang mendasarinya. Server MCP menerjemahkan permintaan standar tersebut ke dalam operasi spesifik dari sistem yang mendasarinya. Standardisasi ini menciptakan efek ekosistem yang kuat. Ketika seorang developer membangun server MCP untuk aplikasi mereka, server tersebut langsung berfungsi dengan setiap model AI yang kompatibel dengan MCP. Ketika seorang developer AI membangun klien MCP ke dalam model atau platform mereka, model tersebut langsung berfungsi dengan setiap server yang kompatibel dengan MCP. Ekosistem alat dan model yang kompatibel tumbuh secara multiplikatif: setiap server MCP baru langsung tersedia untuk semua model yang kompatibel dengan MCP yang sudah ada, dan setiap model yang kompatibel dengan MCP yang baru dapat langsung menggunakan semua server MCP yang sudah ada. Ini secara langsung analog dengan apa yang dilakukan standarisasi USB untuk periferal dan apa yang dilakukan standarisasi Bluetooth untuk perangkat nirkabel. Sebelum USB, menghubungkan perangkat ke komputer membutuhkan kabel dan driver perangkat lunak khusus untuk setiap kombinasi perangkat dan komputer. Setelah USB, perangkat USB apa pun dapat bekerja dengan port USB apa pun. Standar tersebut menghilangkan kompleksitas kombinatorial dari integrasi khusus, memungkinkan ekosistem perangkat dan komputer yang kompatibel yang tumbuh secara independen dan bekerja bersama secara otomatis. MCP sebagai Pengaktif Segala Hal LainnyaUntuk LLM itu sendiri, MCP menyediakan saluran komunikasi di mana model menerima informasi kontekstual yang kaya yang dibutuhkannya agar benar-benar berguna dalam lingkungan tertentu. Tanpa MCP (atau yang setara), LLM hanya beroperasi pada informasi dalam jendela konteks langsungnya — teks apa pun yang diberikan dalam perintah. Dengan MCP, LLM dapat meminta informasi dari sistem yang terhubung pada saat inferensi, memperkaya konteksnya secara dinamis dengan data waktu nyata, informasi spesifik pengguna, dan status sistem. LLM menjadi sadar situasional daripada beroperasi dalam ruang hampa informasi. Untuk RAG, MCP menyediakan mekanisme standar di mana LLM berkomunikasi dengan database vektor atau sistem pengambilan yang menyimpan basis pengetahuan. Alih-alih integrasi khusus antara LLM tertentu dan sistem pengambilan informasi tertentu, arsitektur RAG berbasis MCP memungkinkan model yang kompatibel dengan MCP untuk terhubung ke layanan pengambilan pengetahuan yang kompatibel dengan MCP. Standardisasi ini membuat sistem RAG lebih modular, lebih mudah ditingkatkan, dan lebih interoperabel di berbagai bagian infrastruktur AI suatu organisasi. Bagi agen AI, MCP adalah infrastruktur yang membuat "tangan" menjadi universal, bukan khusus. Setiap alat yang dapat digunakan agen — fungsi pencarian web, lingkungan eksekusi kode, klien email, kalender, sistem file — diekspos sebagai server MCP. Kemampuan perencanaan dan penalaran agen berada di LLM. Kemampuan spesifik setiap alat berada di masing-masing server MCP. MCP adalah sistem saraf yang menghubungkan mereka, memungkinkan LLM untuk memanggil alat yang kompatibel dengan MCP menggunakan pola komunikasi standar yang sama. Mengapa MCP Penting untuk Masa Depan AISebelum MCP, model AI sebagian besar merupakan sistem terisolasi yang memproses teks dan mengembalikan teks. Mereka dapat membantu dalam batasan teks-masuk, teks-keluar tersebut, tetapi kemampuan mereka untuk berpartisipasi dalam alur kerja digital yang kompleks dibatasi oleh upaya rekayasa yang diperlukan untuk setiap integrasi khusus. MCP menghilangkan hambatan itu. Model AI dengan konektivitas MCP dapat berpartisipasi dalam alur kerja digital apa pun yang telah diekspos melalui server MCP, dari operasi file paling sederhana hingga proses bisnis multi-sistem yang paling kompleks. Ini adalah transisi dari otak yang berpikir tentang dunia ke otak yang berpikir dengan dunia — dari kecerdasan yang menggambarkan dan menganalisis ke kecerdasan yang berpartisipasi dan beroperasi. MCP adalah infrastruktur yang memungkinkan transisi itu, dan adopsinya yang cepat di seluruh industri AI menunjukkan bahwa dampak jangka panjangnya pada bagaimana sistem AI dibangun dan diterapkan akan sangat besar. Bagaimana Keempat Komponen Bekerja Bersama: Gambaran LengkapMemahami setiap komponen secara individual sangat berharga, tetapi kekuatan penuh sistem AI modern muncul dari cara keempat komponen ini bergabung. Sebagian besar sistem AI paling mumpuni yang dibangun saat ini mengintegrasikan keempat lapisan tersebut, dan memahami bagaimana mereka bekerja bersama memberi kita model mental lengkap tentang apa yang dapat dilakukan AI modern. Bayangkan asisten AI yang membantu seorang analis keuangan menyiapkan laporan klien. Ketika analis meminta asisten untuk menyiapkan ringkasan tentang kinerja portofolio klien relatif terhadap tolok ukur pasar, inilah yang terjadi di keempat lapisan secara bersamaan. LLM — otak — mengaktifkan pemahaman mendalamnya tentang konsep keuangan, kerangka analitis, struktur naratif, dan komunikasi yang jelas. Ia tahu bagaimana analisis kinerja portofolio biasanya disusun, metrik apa yang penting, bagaimana menafsirkan penyimpangan dari tolok ukur, dan bagaimana mengkomunikasikan temuan dengan jelas kepada klien. MCP — lapisan koneksi — memungkinkan otak untuk berkomunikasi dengan lancar dengan semua sistem yang perlu dikonsultasikan. Sistem ini terhubung ke umpan data keuangan, sistem manajemen dokumen, kalender untuk memeriksa pertemuan klien yang akan datang, dan alat presentasi tempat output akhir akan disampaikan. Semua koneksi ini terjadi melalui satu protokol standar, memungkinkan integrasi yang mulus. RAG — otak ditambah buku — mengambil informasi spesifik yang dibutuhkan LLM agar akurat dan spesifik tentang klien tertentu ini. Sistem ini mengambil kepemilikan portofolio klien dari basis data internal perusahaan, mengambil data kinerja benchmark yang relevan, menemukan pernyataan kebijakan investasi klien, dan menampilkan komentar pasar yang relevan dari laporan riset terbaru. LLM sekarang bekerja dengan informasi spesifik, terkini, dan akurat, bukan pengetahuan umum tentang keuangan. Agen AI — gabungan otak dan tangan — menjalankan alur kerja. Ia menggunakan alat-alatnya untuk menanyakan basis data portofolio, mengambil data benchmark dari API data keuangan, menjalankan perhitungan atribusi kinerja dalam lingkungan eksekusi kode, menghasilkan grafik yang mengilustrasikan analisis, menyusun bagian naratif laporan menggunakan data yang diambil, dan memformat seluruh output sebagai dokumen presentasi yang rapi. Setiap langkah menggunakan alat yang berbeda; penalaran LLM memandu urutan penggunaan alat; hasil dari setiap langkah menginformasikan langkah selanjutnya. Hasilnya adalah pengarahan klien yang komprehensif, akurat, disesuaikan secara spesifik, dan disajikan dengan baik — pekerjaan yang akan memakan waktu beberapa jam bagi analis junior — yang dihasilkan dalam hitungan menit melalui tindakan terkoordinasi dari keempat lapisan. Inilah janji praktis dari sistem AI modern, dan analogi manusia menjelaskan mengapa setiap lapisan diperlukan: tanpa otak, tidak ada kecerdasan; tanpa buku, kecerdasan tidak mengetahui hal-hal spesifik; tanpa tangan, kecerdasan tidak dapat bertindak berdasarkan penalarannya; tanpa lapisan koneksi, otak tidak dapat berkomunikasi dengan apa pun. Advertisement:
Jadi, analogi empat bagian yang dieksplorasi di sini — LLM sebagai otak, RAG sebagai otak ditambah buku, agen AI sebagai otak ditambah tangan, MCP sebagai lapisan koneksi — memberikan kerangka kerja yang koheren, akurat, dan praktis untuk memahami blok bangunan sistem AI modern. Ini menjelaskan mengapa setiap komponen ada: otak membutuhkan buku karena tidak ada otak yang dapat menghafal semuanya, terutama informasi yang tidak ada ketika terakhir kali dipelajari. Otak membutuhkan tangan karena memikirkan tindakan tidak sama dengan melakukannya. Otak membutuhkan lapisan koneksi karena kecerdasan tanpa saluran komunikasi terisolasi dan tidak aktif.
Artikel Terkait:
|