Hospital AI Lab HOSPITAL AI LAB — informasi praktis AI kesehatan

Diperbarui:

Studi Alodokter-Stanford: Cara Menilai Klaim Keamanan AI

Studi Stanford-UC Berkeley menguji AI klinis Alodokter pada 402 konsultasi nyata: pelajaran bagi RS saat menilai klaim keamanan AI dari vendor.

Kecerdasan artifisial (AI) untuk keperluan kesehatan sering dipasarkan dengan angka yang meyakinkan — “akurasi 95 persen”, “aman digunakan”, dan semacamnya. Pertanyaannya, dari mana angka itu berasal, dan seberapa ketat cara mengujinya? Pekan lalu, sebuah studi yang melibatkan peneliti Stanford King Center on Global Development dan UC Berkeley menguji asisten AI klinis milik Alodokter, platform telemedisin Indonesia, dan hasilnya diberitakan luas oleh media dalam negeri (detikINET, 27 September 2026; Liputan6, 22 September 2026). Terlepas dari platform yang diuji, cara studi ini disusun layak dipelajari manajemen rumah sakit sebagai contoh bagaimana seharusnya klaim keamanan AI diperiksa sebelum diterima.

Apa yang sebenarnya diuji

Studi berjudul “Assessing the Clinical Safety of an AI Assistant in Indonesian Chat-Based Telemedicine” ini tidak menggunakan skenario simulasi, melainkan 402 konsultasi nyata antara pasien dan dokter umum di platform Alodokter yang dibantu asisten AI. Setiap konsultasi ditelaah oleh tiga dokter Indonesia secara independen, menggunakan 14 kriteria keselamatan klinis, dan penilaian akhir diambil berdasarkan konsensus ketiganya. Hasilnya, 397 dari 402 konsultasi (98,8 persen) dinilai aman secara klinis. Peran AI dalam konsultasi ini dibatasi pada pengumpulan informasi dan identifikasi tanda bahaya — wewenang diagnosis dan penulisan resep tetap sepenuhnya berada di tangan dokter.

Riset ini terkait dengan proyek yang terdaftar di King Center on Global Development, Stanford, yang bermitra dengan Alodokter untuk menguji akses asisten AI klinis dengan desain acak pada level dokter (King Center on Global Development). Uji coba terkontrol acak (randomized controlled trial) yang lebih luas terhadap dampaknya pada keselamatan pasien disebut baru akan menyusul — artinya angka 98,8 persen ini adalah hasil evaluasi keamanan awal, bukan kesimpulan akhir dari sebuah RCT penuh.

Kekurangan yang diakui sendiri oleh peneliti

Bagian yang justru penting untuk dicermati adalah apa yang tidak dipuji dalam studi ini. Peneliti secara terbuka menyebut dua area yang masih perlu diperkuat: penanganan kondisi yang memerlukan rujukan segera, dan keamanan dosis obat untuk anak. Kedua hal ini justru situasi berisiko tinggi yang paling sering ditemui di unit gawat darurat maupun rawat jalan anak. Studi yang mencantumkan kelemahannya sendiri, bukan hanya angka keberhasilan, adalah salah satu tanda bahwa metodenya bisa dipercaya.

Pertanyaan yang bisa dipinjam saat menilai proposal vendor

Manajemen rumah sakit tidak perlu mereplikasi skala studi ini untuk menilai tawaran AI yang masuk. Namun, lima pertanyaan berikut — yang tercermin dari desain studi Alodokter-Stanford di atas — bisa dipakai sebagai daftar periksa singkat ketika vendor mengajukan klaim serupa:

  • Apakah pengujian dilakukan pada interaksi pasien nyata, atau hanya skenario simulasi?
  • Berapa banyak kasus yang diuji, dan siapa yang menilai — apakah pihak independen, bukan tim internal vendor sendiri?
  • Kriteria apa yang dipakai untuk menyatakan sesuatu “aman” atau “akurat”?
  • Apakah vendor bersedia menyebutkan area yang masih lemah, atau hanya menonjolkan angka keberhasilan?
  • Apakah keputusan klinis akhir tetap berada di tangan tenaga kesehatan berizin, atau AI bertindak sendiri?

Jika sebuah proposal tidak bisa menjawab pertanyaan-pertanyaan ini dengan jelas, itu bukan berarti tawarannya harus ditolak, tetapi tanda untuk memperlambat proses dan meminta penjelasan tertulis lebih dulu — sebelum data pasien atau alur kerja klinis mulai disesuaikan dengan sistem tersebut.

Rangkuman

  • Studi Stanford-UC Berkeley menguji asisten AI klinis Alodokter pada 402 konsultasi nyata, dinilai oleh tiga dokter independen dengan 14 kriteria; 98,8 persen dinilai aman secara klinis, dengan wewenang diagnosis tetap di tangan dokter.
  • Peneliti secara terbuka mengakui dua kelemahan: penanganan rujukan darurat dan keamanan dosis obat anak — bagian yang justru menunjukkan kredibilitas metode penelitiannya.
  • Uji coba acak terkontrol yang lebih luas masih akan menyusul, sehingga angka ini adalah hasil evaluasi awal, bukan kesimpulan final.
  • Manajemen rumah sakit dapat meminjam lima pertanyaan di atas sebagai daftar periksa singkat saat menilai klaim keamanan atau akurasi dari vendor AI mana pun, tanpa perlu mereplikasi skala studi ini sendiri.

Konten di situs ini bersifat informasi umum untuk tujuan penelitian dan edukasi, dan bukan pengganti diagnosis atau saran medis untuk pasien tertentu.

Artikel ini bagian dari seri

Lihat semua seri

← Blog