Ana içeriğe atla

BVA 506 - Büyük Veri için Python ile Makine Öğrenmesi

Lisansüstü Eğitim Enstitüsü · Büyük Veri ve İş Analitiği · Lisansüstü

AKTS: 7.5 T+U+L: 3+0+0 Zorunlu
Koordinatör: Dr. Öğr. Üyesi Aydın TEYMOURIFAR

Dersin Amacı

Bu dersin amacı, büyük veri bağlamında makine öğrenmesine uygulamalı bilgi sunmak ve öğrencilere veri bilimindeki temel kavramları kazandırmaktır. Öğrencilerin Python/Scikit-learn ve PySpark araçlarını kullanarak regresyon, sınıflandırma ve kümeleme problemleri için modeller geliştirmeleri ve bu modelleri değerlendirmeleri hedeflenmektedir. Ders kapsamında doğrusal ve lojistik regresyon, Naïve Bayes, k-en yakın komşu (k-NN), k-means ve hiyerarşik kümeleme, yapay sinir ağları, destek vektör makineleri (SVM) ve performans ölçütleri ele alınacak; pazarlama, finans ve operasyon verileri üzerinde gerçek veri setleriyle uygulamalı projeler yürütülecek ve bu çalışmalar üzerinden yönetsel düzeyde çıkarımlar yapma becerileri geliştirilecektir.

Ders İçeriği

Öğrenciler, Python/Scikit-learn ve PySpark kullanarak regresyon, sınıflandırma ve kümeleme problemleri için modeller geliştirir ve değerlendirir. Konular arasında lineer/logistik regresyon, Naïve Bayes, k-NN, k-means/hiyerarşik kümeleme, yapay sinir ağları, SVM ve performans ölçütleri ve gerçek veri setleriyle çalışılmak yer almaktadır.

Zorunlu Kaynaklar

Ders Notları + Müller, Andreas C., and Sarah Guido. Introduction to machine learning with Python.

Önerilen Kaynaklar

  • O'Reilly Media, 2017..Raschka, Sebastian. Python machine learning. Packt Publishing Ltd, 2015.
  • Grus, Joel. Data Science from Scratch: First Principles with Python. " O'Reilly Media, Inc.", 2015.

Dersin Öğrenme Çıktıları

  1. Tahminleme modellerinin temel kavramlarını açıklayabilecektir.
  2. Sınıflandırma ve regresyon problemlerini çözmek için gözetimli öğrenme yöntemlerini uygulayabilecektir.
  3. Kümeleme problemlerini çözmek için gözetimsiz öğrenme yöntemlerini uygulayabilecektir.
  4. Tahminleme modellerinin performansını analiz edebilecek, yorumlayabilecek ve değerlendirebilecektir.
  5. Python ve PySpark kullanarak temel makine öğrenmesi tekniklerini kodlayabilecektir.

Öğretim Yöntem ve Teknikleri

AnlatımSoru-CevapTartışmaAlıştırma ve UygulamaGrup ÇalışmasıBeyin FırtınasıÖrnek OlayDeney / Laboratuvar / Atölye / Alan UygulamasıBireysel ÇalışmaProblem Çözme

Ölçme ve Değerlendirme

ÖdevPerformans Görevi (Uygulama / Laboratuvar / Atölye / Arazi Çalışması / Seminer / Sunum / Bitirme Çalışması / Tez)Proje / TasarımSınav (Yazılı Sınav / Test: Doğru-Yanlış Testi, Çoktan Seçmeli Testi, Kısa Cevaplı Test, Eşleştirmeli Test)

AKTS / İş Yükü

EtkinlikSayıSüre (saat)Toplam İş Yükü
Ders Süresi (Sınav Haftası Dahil)000
Sınıf Dışı Ders Çalışma Süresi000
Ara Sınav000
Kısa Sınav000
Ödev000
Uygulama000
Final000

Ders Akışı

HaftaKonuÖn Hazırlık
1Makine öğrenmesinin temelleri ve temel kavramlar - Python, Jupyter Notebook, Git/GitHub-
2Gözetimli ve gözetimsiz öğrenmeye giriş - Scikit-learn temel kullanım-
3Lineer regresyon ve uzantıları - Scikit-learn, statsmodels-
4Lojistik regresyon - Scikit-learn-
5Naïve Bayes ve k-en yakın komşu - Scikit-learn-
6K-means ve hiyerarşik kümeleme - Scikit-learn, SciPy-
7Yapay sinir ağlarına giriş - TensorFlow/Keras-
8Destek vektör makineleri - Scikit-learn-
9Karar ağaçları ve rastgele ormanlar - Scikit-learn-
10Kollektif öğrenme yöntemleri - XGBoost, LightGBM, Scikit-learn-
11Büyük veri uygulamaları: regresyon problemleri - PySpark MLlib-
12Büyük veri uygulamaları: sınıflandırma problemleri - PySpark MLlib-
13Büyük veri uygulamaları: kümeleme problemleri - PySpark MLlib-
14Büyük veri uygulamaları: Gerçek hayat problemi çözümü - PySpark MLlib-
15Model değerlendirme ve performans analizi - Scikit-learn metrics, MLflow ile takip-
16Gerçek hayat problemi çözümü-