G
TutoBox
Trang chủ › Khóa học › du-lieu-lon-va-khai-pha-du-lieu
DỮ LIỆU LỚN VÀ KHAI PHÁ DỮ LIỆU

DỮ LIỆU LỚN VÀ KHAI PHÁ DỮ LIỆU

du-lieu-lon-va-khai-pha-du-lieu · 746 Toán và thống kê
☆☆☆☆☆ 0 đánh giá
Đang mở🏷 746 Toán và thống kê
0Sinh viên
0Bài test
0Tài liệu
Đăng ký / Vào lớp

Giảng viên

Chưa phân công giảng viên

Giới thiệu khóa học

Dưới đây là Kế hoạch học tập 15 tuần môn "Dữ liệu lớn và Khai phá dữ liệu" theo đúng mẫu chuẩn bạn đã cung cấp:

Tóm tắt giới thiệu môn học

Môn “Dữ liệu lớn và Khai phá dữ liệu” là sự kết hợp giữa hai lĩnh vực cốt lõi của Khoa học dữ liệu hiện đại: xử lý khối lượng dữ liệu khổng lồ (Big Data) và khai thác thông tin hữu ích từ dữ liệu (Data Mining). Môn học cung cấp cho sinh viên kiến thức và kỹ năng để xử lý dữ liệu lớn bằng các công nghệ tiên tiến (Hadoop, Spark, NoSQL...) đồng thời ứng dụng các thuật toán khai phá dữ liệu như phân cụm, phân loại, luật kết hợp... vào thực tế.

Sinh viên không chỉ học cách thiết kế pipeline xử lý dữ liệu, mà còn hiểu và ứng dụng các kỹ thuật học máy, khai thác tri thức, phát hiện mẫu và dự đoán từ dữ liệu đa dạng.

Chú thích: Đây là môn học then chốt trong lĩnh vực phân tích dữ liệu, ứng dụng trong AI, thương mại điện tử, tài chính, y tế, bảo mật,...

Mục tiêu môn học

Chú thích: Môn học tích hợp lý thuyết và thực hành, giúp sinh viên vận dụng công nghệ để khám phá thông tin có giá trị từ dữ liệu.

Kiến thức tiên quyết

Chú thích: Sinh viên nên nắm được tư duy thuật toán và xử lý dữ liệu để tiếp thu hiệu quả các kỹ thuật khai phá.

Kế hoạch học tập 15 tuần môn “Dữ liệu lớn và Khai phá dữ liệu”

TuầnNội dung học tậpMục tiêu cụ thể / Ghi chú
Tuần 1Tổng quan về Dữ liệu lớn và Khai phá dữ liệuHiểu mối liên hệ giữa Big Data và Data Mining, ứng dụng thực tế.
Tuần 2Hệ sinh thái Big Data: Hadoop, Spark, HDFS, Hive,...Giới thiệu và cài đặt các công cụ trong hệ sinh thái dữ liệu lớn.
Tuần 3Hệ thống lưu trữ và xử lý dữ liệu với HDFS và SparkThực hành lưu trữ dữ liệu và xử lý phân tán.
Tuần 4Tiền xử lý dữ liệu lớn: làm sạch, chuẩn hóa, chọn đặc trưngÁp dụng kỹ thuật tiền xử lý dữ liệu cho khối dữ liệu lớn.
Tuần 5Tổng quan về khai phá dữ liệu: quy trình, nhiệm vụ, công cụCRISP-DM, KDD Process, và giới thiệu các thuật toán phổ biến.
Tuần 6Phân cụm dữ liệu (Clustering): K-means, DBSCAN, HierarchicalHiểu và thực hành phân cụm với dữ liệu lớn bằng Spark MLlib.
Tuần 7Phân loại dữ liệu (Classification): Decision Tree, SVM, Naive BayesỨng dụng phân loại trên dữ liệu lớn, đánh giá mô hình.
Tuần 8Luật kết hợp và khai phá luật (Apriori, FP-Growth)Phát hiện luật liên kết trong tập dữ liệu lớn (giỏ hàng, hành vi người dùng,...).
Tuần 9Khai phá dữ liệu văn bản và dữ liệu phi cấu trúcText mining, sentiment analysis, xử lý dữ liệu từ log, mạng xã hội,...
Tuần 10Phát hiện bất thường và phát hiện gian lậnỨng dụng Data Mining trong an ninh, giám sát, tài chính,...
Tuần 11Xử lý dữ liệu thời gian thực với Kafka, Spark StreamingPipeline thời gian thực, streaming analytics.
Tuần 12Tối ưu hóa và đánh giá mô hình khai phá dữ liệuCross-validation, ROC, Precision/Recall, tuning hyperparameters.
Tuần 13Dự án thực tế: phân tích và khai phá dữ liệu lớnThiết kế và triển khai dự án phân tích dữ liệu nhóm.
Tuần 14Trình bày, phản biện và cải tiến kết quả dự ánĐánh giá lẫn nhau, góp ý cải thiện hệ thống.
Tuần 15Kiểm tra và tổng kết học phầnThi lý thuyết + thực hành đánh giá toàn diện.

Chú thích: Dự án cuối kỳ có thể hướng tới các bài toán thực tế như: phân tích hành vi khách hàng, phát hiện gian lận, phân tích mạng xã hội, dự đoán nhu cầu,...

Nếu bạn cần hỗ trợ thêm các tài nguyên học tập như slide, lab, source code mẫu, hoặc đề thi, mình có thể giúp bạn chuẩn bị đầy đủ. Bạn muốn mình tiếp tục với môn nào tiếp theo?

← Về trang chủ