TRENDING 2024 Docker Compose Orchestration: Koneksi Database, Connection Pooling & ORM • Latihan Praktik & Acuan GitHub Baca Sekarang →
Python & Data Science 1,500 tayangan

Python Data Science 2026: Analisis Data Menggunakan Pandas, NumPy, dan Google Colab

Tim Data DEN.BIZ.ID 26 Juli 2026 2 min baca
Acuan GitHub ↗
Python Data Science 2026: Analisis Data Menggunakan Pandas, NumPy, dan Google Colab

Python adalah bahasa pemrograman nomor satu di dunia untuk Data Science dan Machine Learning. Kombinasi antara library Pandas dan NumPy memungkinkan data analyst mengolah jutaan baris data secara efisien hanya dalam hitungan detik.

1. Mengapa Pandas dan NumPy Menjadi Fondasi Data Science?

Dalam analisis data industri, data mentah jarang berada dalam kondisi rapi. Sering kali terdapat nilai hilang (null values), format tanggal yang tidak konsisten, serta duplikasi baris. Pandas menyediakan struktur data bernama DataFrame yang bertindak seperti tabel spreadsheet cerdas dengan kecepatan tinggi.

2. Latihan Praktik: Eksplorasi Data Penjualan (EDA)

Dalam latihan ini, Anda akan melakukan Exploratory Data Analysis (EDA) sederhana untuk menghitung total penjualan per kategori produk.

Langkah Latihan Mandiri:

  1. Buka Google Colab atau Jupyter Notebook di komputer Anda.
  2. Buat notebook baru dan salin kode latihan di sel pertama.
  3. Jalankan sel dengan menekan kombinasi tombol Shift + Enter.
  4. Amati ringkasan statistik yang keluar di output console.

3. Contoh Kode: Pandas Groupby & Agregasi Statistik

Berikut adalah contoh kode siap pakai untuk membaca data dictionary, membuat DataFrame, dan melakukan agregasi:

import pandas as pd
import numpy as np

# 1. Membuat dataset sintetis penjualan tahun 2026
data = {
    'Tanggal': ['2026-07-01', '2026-07-01', '2026-07-02', '2026-07-02', '2026-07-03'],
    'Kategori': ['AI Server', 'Cloud VPS', 'AI Server', 'Domain', 'Cloud VPS'],
    'Harga': [15000000, 450000, 15000000, 125000, 450000],
    'Terjual': [2, 10, 3, 50, 15]
}

# 2. Konversi ke DataFrame
df = pd.DataFrame(data)

# 3. Menghitung kolom baru: Total Revenue = Harga * Terjual
df['Revenue'] = df['Harga'] * df['Terjual']

# 4. Agregasi: Menghitung total pendapatan dan rata-rata per Kategori
summary = df.groupby('Kategori').agg(
    Total_Revenue=('Revenue', 'sum'),
    Rata_Rata_Harga=('Harga', 'mean'),
    Jumlah_Transaksi=('Terjual', 'count')
).reset_index()

# 5. Menampilkan hasil sorted berdasarkan Total Revenue tertinggi
summary = summary.sort_values(by='Total_Revenue', ascending=False)
print("=== LAPORAN STATISTIK PENJUALAN DEN.BIZ.ID ===")
print(summary.to_string(index=False))

4. Acuan & Referensi GitHub Resmi

Gunakan repositori resmi berikut sebagai referensi dokumentasi saintifik di proyek Anda:

Acuan & Referensi Resmi GitHub

Materi ini merujuk pada standar open-source produksi

Buka Repositori Resmi
git clone https://github.com/pandas-dev/pandas.git

Kuis Interaktif — Uji Pemahaman Anda!

Tes seberapa jauh penguasaan Anda atas materi dan latihan praktik di atas

#1 Struktur data tabular dua dimensi di library Pandas disebut sebagai?

Artikel Terkait dalam Kategori yang Sama