Lisansüstü Eğitim Enstitüsü · Büyük Veri ve İş Analitiği · Lisansüstü
Dersin Amacı
Bu dersin amacı, büyük veri bağlamında makine öğrenmesine uygulamalı bilgi sunmak ve öğrencilere veri bilimindeki temel kavramları kazandırmaktır. Öğrencilerin Python/Scikit-learn ve PySpark araçlarını kullanarak regresyon, sınıflandırma ve kümeleme problemleri için modeller geliştirmeleri ve bu modelleri değerlendirmeleri hedeflenmektedir. Ders kapsamında doğrusal ve lojistik regresyon, Naïve Bayes, k-en yakın komşu (k-NN), k-means ve hiyerarşik kümeleme, yapay sinir ağları, destek vektör makineleri (SVM) ve performans ölçütleri ele alınacak; pazarlama, finans ve operasyon verileri üzerinde gerçek veri setleriyle uygulamalı projeler yürütülecek ve bu çalışmalar üzerinden yönetsel düzeyde çıkarımlar yapma becerileri geliştirilecektir.
Ders İçeriği
Öğrenciler, Python/Scikit-learn ve PySpark kullanarak regresyon, sınıflandırma ve kümeleme problemleri için modeller geliştirir ve değerlendirir. Konular arasında lineer/logistik regresyon, Naïve Bayes, k-NN, k-means/hiyerarşik kümeleme, yapay sinir ağları, SVM ve performans ölçütleri ve gerçek veri setleriyle çalışılmak yer almaktadır.
Zorunlu Kaynaklar
Ders Notları + Müller, Andreas C., and Sarah Guido. Introduction to machine learning with Python.
Önerilen Kaynaklar
- O'Reilly Media, 2017..Raschka, Sebastian. Python machine learning. Packt Publishing Ltd, 2015.
- Grus, Joel. Data Science from Scratch: First Principles with Python. " O'Reilly Media, Inc.", 2015.
Dersin Öğrenme Çıktıları
- Tahminleme modellerinin temel kavramlarını açıklayabilecektir.
- Sınıflandırma ve regresyon problemlerini çözmek için gözetimli öğrenme yöntemlerini uygulayabilecektir.
- Kümeleme problemlerini çözmek için gözetimsiz öğrenme yöntemlerini uygulayabilecektir.
- Tahminleme modellerinin performansını analiz edebilecek, yorumlayabilecek ve değerlendirebilecektir.
- Python ve PySpark kullanarak temel makine öğrenmesi tekniklerini kodlayabilecektir.
Öğretim Yöntem ve Teknikleri
Ölçme ve Değerlendirme
AKTS / İş Yükü
| Etkinlik | Sayı | Süre (saat) | Toplam İş Yükü |
|---|---|---|---|
| Ders Süresi (Sınav Haftası Dahil) | 0 | 0 | 0 |
| Sınıf Dışı Ders Çalışma Süresi | 0 | 0 | 0 |
| Ara Sınav | 0 | 0 | 0 |
| Kısa Sınav | 0 | 0 | 0 |
| Ödev | 0 | 0 | 0 |
| Uygulama | 0 | 0 | 0 |
| Final | 0 | 0 | 0 |
Ders Akışı
| Hafta | Konu | Ön Hazırlık |
|---|---|---|
| 1 | Makine öğrenmesinin temelleri ve temel kavramlar - Python, Jupyter Notebook, Git/GitHub | - |
| 2 | Gözetimli ve gözetimsiz öğrenmeye giriş - Scikit-learn temel kullanım | - |
| 3 | Lineer regresyon ve uzantıları - Scikit-learn, statsmodels | - |
| 4 | Lojistik regresyon - Scikit-learn | - |
| 5 | Naïve Bayes ve k-en yakın komşu - Scikit-learn | - |
| 6 | K-means ve hiyerarşik kümeleme - Scikit-learn, SciPy | - |
| 7 | Yapay sinir ağlarına giriş - TensorFlow/Keras | - |
| 8 | Destek vektör makineleri - Scikit-learn | - |
| 9 | Karar ağaçları ve rastgele ormanlar - Scikit-learn | - |
| 10 | Kollektif öğrenme yöntemleri - XGBoost, LightGBM, Scikit-learn | - |
| 11 | Büyük veri uygulamaları: regresyon problemleri - PySpark MLlib | - |
| 12 | Büyük veri uygulamaları: sınıflandırma problemleri - PySpark MLlib | - |
| 13 | Büyük veri uygulamaları: kümeleme problemleri - PySpark MLlib | - |
| 14 | Büyük veri uygulamaları: Gerçek hayat problemi çözümü - PySpark MLlib | - |
| 15 | Model değerlendirme ve performans analizi - Scikit-learn metrics, MLflow ile takip | - |
| 16 | Gerçek hayat problemi çözümü | - |


