G
TutoBox
Trang chủ › Khóa học › du-lieu-lon-big-data
DỮ LIỆU LỚN BIG DATA

DỮ LIỆU LỚN BIG DATA

du-lieu-lon-big-data · 746 Toán và thống kê
☆☆☆☆☆ 0 đánh giá
Đang mở🏷 746 Toán và thống kê
2Sinh viên
0Bài test
0Tài liệu
Đăng ký / Vào lớp

Giảng viên

Chưa phân công giảng viên

Giới thiệu khóa học

Dưới đây là Kế hoạch học tập 15 tuần môn “Dữ liệu lớn (Big Data)” theo đúng cấu trúc mẫu bạn đã cung cấp:

Tóm tắt giới thiệu môn học

Môn “Dữ liệu lớn (Big Data)” trang bị cho sinh viên kiến thức nền tảng và kỹ năng thực hành về việc xử lý, lưu trữ và phân tích các tập dữ liệu có kích thước rất lớn, đa dạng và thay đổi nhanh chóng. Đây là một lĩnh vực thiết yếu trong kỷ nguyên dữ liệu hiện đại, với ứng dụng rộng rãi trong các ngành như tài chính, y tế, marketing, logistics và trí tuệ nhân tạo.

Sinh viên sẽ được làm quen với các mô hình lưu trữ phân tán, các công nghệ như Hadoop, Spark, NoSQL, cũng như các kỹ thuật xử lý dữ liệu song song và phân tán. Ngoài ra, môn học còn nhấn mạnh khả năng trích xuất thông tin giá trị từ dữ liệu lớn thông qua các phương pháp khai phá và học máy.

Chú thích: Môn học là cầu nối giữa nền tảng công nghệ thông tin và các ứng dụng phân tích dữ liệu thực tế, giúp sinh viên sẵn sàng tham gia các dự án dữ liệu lớn trong doanh nghiệp.

Mục tiêu môn học

Chú thích: Môn học tập trung nhiều vào thực hành, kỹ năng triển khai hệ thống, và ứng dụng vào bài toán thực tế.

Kiến thức tiên quyết

Chú thích: Sinh viên không cần quá giỏi lập trình, nhưng cần thành thạo kỹ năng làm việc với dữ liệu và hệ thống.

Kế hoạch học tập 15 tuần môn “Dữ liệu lớn (Big Data)”

TuầnNội dung học tậpMục tiêu cụ thể / Ghi chú
Tuần 1Tổng quan về Big Data và các công nghệ liên quanGiới thiệu 5V của Big Data, hệ sinh thái công nghệ, ứng dụng thực tế.
Tuần 2Kiến trúc hệ thống Big Data – phân tán và song songTìm hiểu hệ thống lưu trữ và xử lý phân tán (cluster, Hadoop ecosystem).
Tuần 3Hệ thống tập tin phân tán HDFSCách hoạt động của HDFS, quản lý dữ liệu lớn, thực hành lưu trữ trên HDFS.
Tuần 4Lập trình MapReduce cơ bảnHiểu và triển khai thuật toán MapReduce để xử lý song song dữ liệu.
Tuần 5Apache Hadoop – thực hành và quản lýCài đặt, cấu hình Hadoop, chạy job MapReduce.
Tuần 6Apache Spark – kiến trúc và RDDSo sánh Hadoop vs Spark, giới thiệu Resilient Distributed Dataset (RDD).
Tuần 7PySpark – xử lý dữ liệu lớn bằng PythonLàm quen với Spark DataFrame, Spark SQL, thao tác dữ liệu lớn bằng Python.
Tuần 8NoSQL databases – MongoDB, CassandraGiới thiệu hệ CSDL NoSQL, lưu trữ dữ liệu phi cấu trúc và phân tán.
Tuần 9Hệ thống xử lý dữ liệu thời gian thực – Kafka, FlinkLuồng dữ liệu thời gian thực, mô hình Pub/Sub, xử lý streaming.
Tuần 10Hệ thống phân tích – Hive, Impala, PrestoTruy vấn dữ liệu lớn theo mô hình SQL trên HDFS.
Tuần 11Tối ưu hóa và giám sát hệ thống Big DataCác công cụ monitoring, đánh giá hiệu suất xử lý.
Tuần 12Phân tích dữ liệu lớn với MLlib và các thư viện học máyÁp dụng mô hình học máy vào dữ liệu lớn bằng Spark MLlib.
Tuần 13Project thực hành – thiết kế pipeline xử lý dữ liệu lớnSinh viên làm theo nhóm xây dựng hệ thống xử lý từ thu thập đến phân tích dữ liệu.
Tuần 14Báo cáo và trình bày dự ánTrình bày kết quả thực hành, thuyết trình và phản biện nhóm.
Tuần 15Kiểm tra cuối kỳ và tổng kếtBài thi lý thuyết + thực hành đánh giá kiến thức toàn diện.

Chú thích: Học phần nên đi kèm với các phòng lab hoặc môi trường ảo hóa (VDI, Docker, Google Colab, hoặc AWS) để sinh viên thực hành trực tiếp.

Nếu bạn cần thêm:

Hãy nói mình biết để mình hỗ trợ chi tiết hơn!

← Về trang chủ