G
TutoBox
Trang chủ › Khóa học › phan-tich-du-lieu-lon-big-data
PHÂN TÍCH DỮ LIỆU LỚN BIG DATA

PHÂN TÍCH DỮ LIỆU LỚN BIG DATA

phan-tich-du-lieu-lon-big-data · 734 Kinh doanh và quản lý
☆☆☆☆☆ 0 đánh giá
Đang mở🏷 734 Kinh doanh và quản lý
0Sinh viên
0Bài test
0Tài liệu
Đăng ký / Vào lớp

Giảng viên

Chưa phân công giảng viên

Giới thiệu khóa học

Dưới đây là đề‑cương 15tuần cho môn “Phântích DữliệuLớn (BigData Analytics)” – đồng bộ giọng văn, định dạng và độ chi tiết với các học phần trước, sẵn sàng đưa vào hồ sơ chương trình.

1. Tóm tắt giới thiệu môn học

Phântích DữliệuLớn trang bị cho sinh viên kiến thức và kỹ năng xử lý – khai thác – phân tích tập dữ liệu có khối lượng (Volume), tốc độ (Velocity) và đa dạng (Variety) vượt khả năng công cụ truyền thống. Môn học kết hợp kiến trúc Hadoop & Spark, kỹ thuật lưu trữ phân tán, xử lý song song, mô hình học máy phân tán, cùng thực hành trên cluster ảo/đám mây. Đây là bước đệm cho các học phần Khoa học dữ liệu nâng cao, Machine Learning at Scale và Kiến trúc dữ liệu doanh nghiệp.

2. Mục tiêu môn học

  1. Hiểu đặc trưng 5V của BigData và hệ sinh thái công nghệ liên quan.

  2. Thiết kế & triển khai pipeline ETL phân tán bằng Hadoop HDFS, Hive, Spark SQL.

  3. Áp dụng Spark MLlib cho phân cụm, phân loại và dự báo trên dữ liệu lớn.

  4. Tối ưu hiệu năng & quản trị tài nguyên (partitioning, caching, cluster tuning).

  5. Xây dựng dashboard realtime và kể chuyện dữ liệu quy mô lớn cho ra quyết định.

3. Kiến thức tiên quyết

4. Kế hoạch học tập 15tuần

TuầnChủ đềMục tiêu / Hoạt động chính
1Giới thiệu BigData & kiến trúc Lambda/KappaSo sánh batch vs streaming, use‑case Netflix, Grab.
2HDFS & lưu trữ phân tánReplication, block size, bài lab upload – query file 10GB.
3MapReduce căn bảnWordCount, shuffle & sort, performance metric.
4Hive & SQL‑on‑HadoopExternal vs managed table, partition, bucketing; lab truy vấn TB log.
5Apache Spark RDD & DataFrameTransformations vs actions, lazy evaluation, Spark UI.
6Spark SQL & thao tác dữ liệuCatalyst optimizer, Tungsten, lab join 3 bảng >5GB.
7Streaming với Spark Structured StreamingSource Kafka, window aggregation, exactly‑once semantics.
8Machine Learning phân tán (MLlib)Pipeline API, feature hashing; k‑means trên 1M record.
9Phân loại & dự báo với Spark MLLogistic, Random Forest, hyper‑parameter tuning trên cluster.
10Graph processing với GraphXPageRank, community detection, ứng dụng social network.
11NoSQL cho BigDataHBase, Cassandra; thiết kế bảng wide‑column.
12Quản trị workflow & OrchestrationAirflow, Oozie; DAG cho ETL hằng ngày.
13Visual hóa & BI trên dữ liệu lớnSuperset/Grafana, DRUID/ClickHouse cho realtime dashboard.
14Thuyết trình dự án nhóm (BigData Use‑Case)Nhóm demo pipeline end‑to‑end + insight & khuyến nghị.
15Ôn tập & kiểm tra cuối kỳThi viết (60%) + đánh giá dự án (40%).

5. Phương pháp giảng dạy

6. Đánh giá

Thành phầnTỷ lệHình thức
Quiz / Lab Check Point10%Trắc nghiệm + câu hỏi CLI/Spark
Bài tập cá nhân (notebook + script)20%ETL & MLlib trên dataset >1GB
Dự án nhóm (BigData Pipeline)30%Repo code + báo cáo + demo tuần14
Mid‑term (Tuần8)15%Trắc nghiệm & bài tập MapReduce/Spark
Final Exam (Tuần15)25%Tự luận + thiết kế kiến trúc

Đề‑cương này giúp sinh viên chuyển từ phân tích dữ liệu truyền thống sang xử lý dữ liệu ở quy mô hàngtỷ bản ghi, xây dựng năng lực cốt lõi để làm việc trong các vị trí Data Engineer, BigData Analyst và CloudDataPlatform Specialist.

← Về trang chủ