Dưới đây là đề‑cương 15tuần cho môn “Phântích DữliệuLớn (BigData Analytics)” – đồng bộ giọng văn, định dạng và độ chi tiết với các học phần trước, sẵn sàng đưa vào hồ sơ chương trình.
Phântích DữliệuLớn trang bị cho sinh viên kiến thức và kỹ năng xử lý – khai thác – phân tích tập dữ liệu có khối lượng (Volume), tốc độ (Velocity) và đa dạng (Variety) vượt khả năng công cụ truyền thống. Môn học kết hợp kiến trúc Hadoop & Spark, kỹ thuật lưu trữ phân tán, xử lý song song, mô hình học máy phân tán, cùng thực hành trên cluster ảo/đám mây. Đây là bước đệm cho các học phần Khoa học dữ liệu nâng cao, Machine Learning at Scale và Kiến trúc dữ liệu doanh nghiệp.
Hiểu đặc trưng 5V của BigData và hệ sinh thái công nghệ liên quan.
Thiết kế & triển khai pipeline ETL phân tán bằng Hadoop HDFS, Hive, Spark SQL.
Áp dụng Spark MLlib cho phân cụm, phân loại và dự báo trên dữ liệu lớn.
Tối ưu hiệu năng & quản trị tài nguyên (partitioning, caching, cluster tuning).
Xây dựng dashboard realtime và kể chuyện dữ liệu quy mô lớn cho ra quyết định.
Phân tích Dữ liệu Kinh doanh hoặc tương đương (Python pandas, SQL, thống kê cơ bản).
Khuyến khích sinh viên đã học lập trình hướng đối tượng & hệ quản trị CSDL.
| Tuần | Chủ đề | Mục tiêu / Hoạt động chính |
|---|---|---|
| 1 | Giới thiệu BigData & kiến trúc Lambda/Kappa | So sánh batch vs streaming, use‑case Netflix, Grab. |
| 2 | HDFS & lưu trữ phân tán | Replication, block size, bài lab upload – query file 10GB. |
| 3 | MapReduce căn bản | WordCount, shuffle & sort, performance metric. |
| 4 | Hive & SQL‑on‑Hadoop | External vs managed table, partition, bucketing; lab truy vấn TB log. |
| 5 | Apache Spark RDD & DataFrame | Transformations vs actions, lazy evaluation, Spark UI. |
| 6 | Spark SQL & thao tác dữ liệu | Catalyst optimizer, Tungsten, lab join 3 bảng >5GB. |
| 7 | Streaming với Spark Structured Streaming | Source Kafka, window aggregation, exactly‑once semantics. |
| 8 | Machine Learning phân tán (MLlib) | Pipeline API, feature hashing; k‑means trên 1M record. |
| 9 | Phân loại & dự báo với Spark ML | Logistic, Random Forest, hyper‑parameter tuning trên cluster. |
| 10 | Graph processing với GraphX | PageRank, community detection, ứng dụng social network. |
| 11 | NoSQL cho BigData | HBase, Cassandra; thiết kế bảng wide‑column. |
| 12 | Quản trị workflow & Orchestration | Airflow, Oozie; DAG cho ETL hằng ngày. |
| 13 | Visual hóa & BI trên dữ liệu lớn | Superset/Grafana, DRUID/ClickHouse cho realtime dashboard. |
| 14 | Thuyết trình dự án nhóm (BigData Use‑Case) | Nhóm demo pipeline end‑to‑end + insight & khuyến nghị. |
| 15 | Ôn tập & kiểm tra cuối kỳ | Thi viết (60%) + đánh giá dự án (40%). |
60% lab thực hành trên cluster sandbox (Docker‑Compose hoặc cloud EMR).
Case study Việt Nam & quốc tế (log click‑stream, IoT, fintech).
Dự án nhóm xuyên suốt: xây dựng pipeline Spark từ ingest → analysis → dashboard.
Khách mời Data Engineer / Cloud Architect chia sẻ kinh nghiệm triển khai thực tế.
| Thành phần | Tỷ lệ | Hình thức |
|---|---|---|
| Quiz / Lab Check Point | 10% | Trắc nghiệm + câu hỏi CLI/Spark |
| Bài tập cá nhân (notebook + script) | 20% | ETL & MLlib trên dataset >1GB |
| Dự án nhóm (BigData Pipeline) | 30% | Repo code + báo cáo + demo tuần14 |
| Mid‑term (Tuần8) | 15% | Trắc nghiệm & bài tập MapReduce/Spark |
| Final Exam (Tuần15) | 25% | Tự luận + thiết kế kiến trúc |
Đề‑cương này giúp sinh viên chuyển từ phân tích dữ liệu truyền thống sang xử lý dữ liệu ở quy mô hàngtỷ bản ghi, xây dựng năng lực cốt lõi để làm việc trong các vị trí Data Engineer, BigData Analyst và CloudDataPlatform Specialist.