Orange Data Mining: Tutorial No-Code dari Instal sampai Model Pertama
Blog/Tips & Trik/Orange Data Mining: Tutorial No-Code dari Instal sampai Model Pertama

Orange Data Mining: Tutorial No-Code dari Instal sampai Model Pertama

BimaBima
·5 September 2025·12 menit baca

Penulis

Bima

Bima

Founder & Data Professional

Bagikan

TL;DR

Orange Data Mining adalah software analisis data open source dari Universitas Ljubljana yang jalan dengan cara nyambungin widget di kanvas, tanpa nulis kode. Alur dasarnya: widget File buat muat data, Select Columns buat nentuin target, widget model kayak Tree atau Logistic Regression, lalu Test and Score buat ngukur hasilnya. Satu workflow klasifikasi lengkap bisa kelar dalam 20 menit.

Orange Data Mining adalah software analisis data open source yang jalan dengan cara nyambungin kotak-kotak widget di kanvas, tanpa nulis satu baris kode.

Dibikin sama Bioinformatics Lab di Universitas Ljubljana, Slovenia. Gratis, dan bisa dipakai di Windows, macOS, maupun Linux.

Buat kamu yang lagi nyusun skripsi atau baru masuk ke data mining, Orange nutup jarak yang paling bikin frustrasi: kamu bisa lihat hasil model dalam 20 menit tanpa harus belajar Python dulu.

Apa itu Orange Data Mining?

Orange adalah tool analisis data dan machine learning berbasis kanvas visual. Kamu narik widget ke kanvas, nyambungin pakai garis, dan tiap sambungan ngalirin data dari satu widget ke widget berikutnya. Rangkaian widget itu disebut workflow, dan bisa disimpan sebagai file .ows buat dijalanin ulang.

Yang bikin dia enak buat belajar: tiap widget bisa kamu buka buat lihat isi datanya di titik itu. Jadi kamu tau persis apa yang berubah setelah tiap langkah.

Dokumentasi resminya ada di halaman dokumentasi Orange Data Mining.

Gimana cara instal Orange Data Mining?

Cara paling gampang pakai installer mandiri dari situs resminya. Installer itu udah bawa Python dan semua library yang dibutuhin, jadi kamu nggak perlu ngurus environment sendiri. Kalau kamu udah punya Python dan terbiasa pakai pip atau conda, ada juga jalur instalasi lewat paket orange3.

  1. Buka orangedatamining.com, klik Download, lalu pilih installer sesuai sistem operasi kamu.
  2. Jalankan installer-nya. Di Windows, ukurannya cukup besar soalnya Python ikut dibundel. Sediain ruang disk sekitar 2 GB.
  3. Buka Orange. Layar pertama nampilin daftar contoh workflow. Tutup dulu, kita mulai dari kanvas kosong.
  4. Kalau butuh widget tambahan, buka menu Options lalu Add-ons. Yang paling sering dipakai: Text Mining buat data teks dan Time Series buat data deret waktu.

Buat jalur pip, perintahnya:

pip install orange3
python -m Orange.canvas

Saran aku buat pemula: pakai installer. Jalur pip sering ketemu masalah versi library, dan itu bikin kamu habis waktu di hal yang bukan inti belajarnya.

Gimana cara muat data ke Orange?

Pakai widget File. Dia baca format CSV, Excel, dan format asli Orange yaitu .tab. Setelah file kebaca, Orange nebak tipe tiap kolom dan perannya. Bagian ini yang harus kamu cek manual, soalnya tebakannya nggak selalu bener buat kolom kode angka.

Langkahnya:

  1. Tarik widget File dari panel kiri ke kanvas. Klik dua kali buat buka.
  2. Klik ikon folder, pilih file CSV kamu.
  3. Lihat tabel di bagian bawah. Ada tiga kolom penting: Name, Type, dan Role.
  4. Set Type dengan bener. Ada empat pilihan:
    • numeric buat angka yang boleh dihitung, misalnya nilai belanja.
    • categorical buat kategori, misalnya kota atau kelas produk.
    • text buat teks bebas kayak nama atau catatan.
    • datetime buat tanggal.
  5. Set Role. Kolom yang mau kamu tebak diset jadi target. Kolom identitas kayak pelanggan_id diset jadi meta biar nggak ikut dilatih. Sisanya biarin feature.

Kesalahan paling sering di langkah ini: kolom member_id yang isinya angka kebaca sebagai numeric dan ikut masuk ke model sebagai fitur. Modelnya lalu belajar dari nomor urut, dan akurasinya keliatan bagus padahal ngawur.

Setelah File beres, sambungin ke widget Data Table buat lihat isi datanya. Cek jumlah baris dan kolomnya cocok sama file aslinya.

Widget apa yang dipakai buat ngecek kualitas data?

Empat widget nutup pemeriksaan dasar: Data Table buat lihat isi, Feature Statistics buat ringkasan tiap kolom, Distributions buat sebaran satu kolom, dan Scatter Plot buat hubungan dua kolom. Impute dipakai kalau ada nilai kosong yang perlu diisi.

WidgetBuat apaYang dicek
Data TableLihat baris mentahJumlah baris, kolom nyasar
Feature StatisticsRingkasan per kolomPersen kosong, min, maks, sebaran
DistributionsSebaran satu kolomNilai ekstrem, kelas timpang
Scatter PlotHubungan dua kolomPola dan pencilan
ImputeIsi nilai kosongRata-rata, modus, atau hapus baris
Select ColumnsAtur peran kolomTarget, fitur, meta

Widget Feature Statistics yang paling hemat waktu. Sekali buka, kamu langsung lihat kolom mana yang kosongnya banyak dan kolom mana yang nilainya cuma satu macam. Kolom dengan satu nilai unik bisa langsung dibuang, dia nggak nyumbang apa-apa ke model.

Kalau istilah kualitas datanya masih asing, ada penjelasannya di halaman data quality.

Gimana cara bikin model klasifikasi pertama di Orange?

Susun lima widget berurutan: File, Select Columns, satu atau lebih widget model, Test and Score, lalu Confusion Matrix. Test and Score yang ngurus pembagian data latih dan uji, jadi kamu nggak perlu misahin file sendiri.

Ini urutan lengkapnya:

  1. File muat data, target udah diset.
  2. Select Columns buang kolom identitas dan kolom yang bocorin jawaban. Kolom yang isinya turunan langsung dari target harus dibuang, misalnya kolom tanggal_berhenti waktu targetnya berhenti_ya_tidak.
  3. Tarik dua widget model: Tree dan Logistic Regression. Sambungin dua-duanya ke Test and Score.
  4. Test and Score. Di panel kiri, pilih metode pengujian:
    • Cross validation dengan 5 atau 10 lipatan buat data kecil sampai sedang.
    • Random sampling kalau kamu mau atur porsi latih dan uji sendiri.
  5. Sambungin keluaran Test and Score ke Confusion Matrix buat lihat salah tebaknya di kelas mana.

Waktu Test and Score kebuka, kamu bakal lihat tabel berisi AUC, CA, F1, Precision, dan Recall per model. Yang perlu kamu pahami:

UkuranArtinyaKapan dipakai
CA (akurasi)Porsi tebakan yang benerCuma berguna kalau kelasnya seimbang
PrecisionDari yang ditebak positif, berapa yang benerKalau salah tuduh itu mahal
RecallDari semua yang beneran positif, berapa yang ketangkapKalau kelewat itu mahal
F1Rata-rata seimbang precision dan recallRingkasan cepat
AUCKemampuan model misahin dua kelasTahan sama kelas timpang

Kalau data kamu isinya 95 persen kelas "nggak berhenti", model yang selalu nebak "nggak berhenti" bakal dapat akurasi 95 persen. Angka itu keliatan bagus dan sama sekali nggak berguna. Lihat AUC dan recall, bukan CA.

Contoh kasus: nebak member yang berhenti belanja di toko_berkah

Aku pakai dataset toko_berkah punya ngulikdata: 3.104 member dengan riwayat belanja setahun dari satu toko sembako di Bekasi.

Persiapannya di luar Orange, cuma tiga kolom turunan per member: jarak hari sejak belanja terakhir, jumlah transaksi setahun, dan rata-rata nilai belanja. Target-nya kolom berhenti, isinya ya atau nggak, ditentukan dari nggak ada transaksi 90 hari terakhir.

Sebaran kelasnya timpang: 612 member berhenti, 2.492 masih aktif. Porsinya 19,7 persen berbanding 80,3 persen.

Hasil Test and Score dengan cross validation 10 lipatan:

ModelAUCCAF1Recall
Logistic Regression0,8470,8610,6120,548
Tree0,7910,8420,5840,571
Selalu tebak "aktif"0,5000,8030,0000,000

Baris ketiga itu yang paling penting. Model bodoh yang selalu nebak "aktif" dapat akurasi 80,3 persen, cuma selisih 5,8 poin dari Logistic Regression. Kalau aku cuma lihat CA, aku bakal nyimpulin modelnya nggak berguna.

Tapi recall-nya 0,548. Artinya model nangkep 335 dari 612 member yang beneran berhenti. Buat toko yang tadinya nggak punya daftar sama sekali, 335 nama itu jauh lebih berguna daripada nol.

Widget Confusion Matrix nunjukin sisi lemahnya: 214 member aktif salah ditandai bakal berhenti. Buat kasus kirim pesan promo, salah tanda itu murah, paling cuma pesan yang nggak perlu. Jadi modelnya layak dipakai.

Kerangka mikir kayak gini ada urutannya di panduan CRISP-DM, terutama di fase Evaluation.

Kesalahan umum waktu pakai Orange

  • Kolom ID ikut jadi fitur. Set jadi meta di widget File atau buang di Select Columns.
  • Kebocoran target. Kolom yang cuma ada setelah kejadiannya terjadi nggak boleh masuk. Ini bikin akurasi kamu nyaris sempurna dan modelnya nggak kepakai di dunia nyata.
  • Cuma lihat akurasi. Di data timpang, akurasi bisa nipu. Bandingin sama tebakan asal.
  • Nggak nyimpan workflow. Simpan file .ows. Tanpa itu, kamu nggak bisa ngulang hasil bulan depan.
  • Tarik data sejuta baris langsung ke Scatter Plot. Orange bakal ngelag. Pakai widget Data Sampler dulu.
  • Ngubah tipe kolom di tengah alur. Beresin tipe dan peran di widget File, sekali, di awal.

Satu tips terakhir: kalau segmentasi yang kamu mau, bukan prediksi, pakai widget k-Means plus Silhouette Plot. Konsepnya aku bahas di halaman segmentation.

FAQ

Orange Data Mining gratis atau berbayar?

Gratis dan open source, dirilis di bawah lisensi GPL. Kamu bisa pakai buat skripsi, kerjaan kantor, sampai proyek komersial tanpa bayar lisensi. Ini bedanya sama SPSS yang lisensinya mahal. Pengembangnya Bioinformatics Lab di Universitas Ljubljana, dan kodenya terbuka di GitHub kalau kamu mau lihat isinya.

Orange bisa jalan di laptop kentang nggak?

Bisa buat data ukuran sedang. Patokan kasarnya, data di bawah 100 ribu baris dengan RAM 8 GB masih nyaman. Yang bikin berat biasanya widget visualisasi kayak Scatter Plot dengan puluhan ribu titik, bukan bagian modelnya. Kalau laptop kamu mulai ngelag, kurangi kolom dulu pakai Select Columns sebelum masuk ke visualisasi.

Perlu ngerti statistik dulu sebelum pakai Orange?

Nggak perlu jago, tapi kamu harus ngerti tiga hal biar hasilnya nggak menyesatkan: bedanya data latih dan data uji, arti akurasi dan kenapa dia bisa menipu di data nggak seimbang, dan cara baca confusion matrix. Tiga itu bisa kamu pelajari dalam sejam, dan Orange nampilin ketiganya di widget Test and Score.

Bedanya Orange sama KNIME dan RapidMiner apa?

Ketiganya sama-sama no-code berbasis widget. Orange paling ringan dan paling enak buat belajar soalnya visualisasinya interaktif dan jumlah widget-nya nggak bikin bingung. KNIME lebih kuat buat alur data yang panjang dan integrasi database. RapidMiner lebih ke arah produk perusahaan berbayar. Buat skripsi dan latihan, Orange paling cepat bikin kamu ngerti.

Hasil dari Orange bisa dipakai buat skripsi?

Bisa, dan cukup umum dipakai. Yang perlu kamu siapin: tulis versi Orange yang kamu pakai, sebut algoritma dan parameternya persis seperti di widget, jelasin cara pembagian data latih dan uji, lalu lampirin tangkapan layar workflow. Simpan juga file .ows biar hasilnya bisa diulang penguji.

Workflow pertama kamu hari ini

Tiga hal yang nentuin hasil di Orange: peran kolom yang bener di widget File, kolom bocor yang dibuang di Select Columns, dan pilihan ukuran evaluasi yang cocok sama data kamu.

Sisanya tinggal narik garis antar widget.

Unduh Orange sekarang, muat satu file CSV yang udah ada di laptop kamu, lalu sambungin File ke Data Table dan Feature Statistics. Sepuluh menit, dan kamu udah tau kondisi data kamu lebih baik dari sebelumnya.

Kalau mau ngerti urutan teknis di balik tiap langkahnya, lanjut ke tahapan data mining dari seleksi data sampai evaluasi pola.

Coba Langsung

Mau praktek langsung? Mulai latihan SQL gratis

Latihan interaktif, langsung di browser.

Buka NgulikSQL →
Bagikan:
Bima
Ditulis oleh

Bima

Founder & Data Professional

Founder Ngulik Data. Passionate about making data analysis accessible for everyone.

Artikel terkait

Pandas groupby: Agregasi Data ala Pivot di Python (2026)
Tips & Trik
20 Juli 2026•9 menit baca

Pandas groupby: Agregasi Data ala Pivot di Python (2026)

groupby ngelompokin baris berdasarkan kolom, lalu ngitung ringkasan per grup kayak total atau rata-rata. Ini pivot-nya pandas.

BimaBima
Pandas to_excel: Ekspor DataFrame ke Excel (2026)
Tips & Trik
18 Juli 2026•8 menit baca

Pandas to_excel: Ekspor DataFrame ke Excel (2026)

to_excel nyimpen DataFrame pandas jadi file Excel .xlsx. Ini cara pakainya, dari satu sheet sampai banyak sheet, plus setelan yang bikin hasilnya rapi.

BimaBima
Pandas read_excel: Baca File Excel di Python
Tips & Trik
16 Juli 2026•8 menit baca

Pandas read_excel: Baca File Excel di Python

pandas read_excel baca file Excel jadi DataFrame, bisa pilih sheet tertentu dan lompatin baris judul yang berantakan. Ini cara pakai plus parameter penting dengan contoh data toko.

BimaBima
Kembali ke Blog
Ngulik Data logoNgulik Data

Platform edukasi data lengkap untuk professionals Indonesia. Belajar SQL, Data Analysis, dan lebih banyak lagi dengan praktek langsung dan feedback real-time.

© 2026 Ngulik Data. Semua hak dilindungi.

TAUTAN
BantuanHargaDatasetBlogAfiliasi
LEGAL
Syarat & KetentuanKebijakan Privasi
Ngulik Data
DatasetLeaderboardBlogStore