Sentiment Analysis
Xem dạng PDF[SST5] Phân Loại Cảm Xúc Câu Đánh Giá Phim
Mô tả bài toán
Phân tích cảm xúc là bài toán nền tảng của xử lý ngôn ngữ tự nhiên, được ứng dụng trong phân tích phản hồi khách hàng, giám sát mạng xã hội và hệ thống gợi ý. Khác với bài toán phân loại hai lớp (tích cực và tiêu cực), bài toán này yêu cầu phân biệt mức độ cảm xúc một cách chi tiết. Đây là thách thức lớn vì các câu đánh giá thường chứa phủ định, mỉa mai, hoặc trộn lẫn lời khen và lời chê trong cùng một câu.
Thí sinh được cung cấp các câu nhận xét phim bằng tiếng Anh, trích từ bộ dữ liệu Stanford Sentiment Treebank (SST-5). Mỗi mẫu là một câu và có đúng một nhãn cảm xúc thuộc một trong năm lớp cố định.
Cho một câu văn bản S, nhiệm vụ của bạn là xây dựng mô hình dự đoán nhãn cảm xúc cho câu đó.
Danh sách các lớp (5 lớp)
| Nhãn | Tên lớp | Ý nghĩa |
|---|---|---|
0 |
very negative | Rất tiêu cực |
1 |
negative | Tiêu cực |
2 |
neutral | Trung tính |
3 |
positive | Tích cực |
4 |
very positive | Rất tích cực |
Các lớp có thứ tự từ rất tiêu cực đến rất tích cực. Thí sinh có thể tận dụng tính chất này khi thiết kế mô hình.
Định dạng dữ liệu
Dữ liệu huấn luyện
Tập huấn luyện gồm các file văn bản và nhãn tương ứng:
train.txt: mỗi dòng là một câu tiếng Anh.train.labels: mỗi dòng là nhãn của câu tương ứng trongtrain.txt.dev.txt: mỗi dòng là một câu tiếng Anh dùng để đánh giá mô hình trong quá trình phát triển.dev.labels: mỗi dòng là nhãn của câu tương ứng trongdev.txt.
Các dòng trong file câu và file nhãn tương ứng với nhau theo thứ tự. Ví dụ, dòng thứ nhất trong train.labels là nhãn của câu thứ nhất trong train.txt.
Dữ liệu đầu vào để dự đoán
Tải và giải nén file chứa test.txt tại liên kết bên dưới. File này chỉ chứa câu văn bản, mỗi dòng một câu. Thí sinh cần chạy mô hình trên chính file test.txt này để tạo file dự đoán được dùng để chấm điểm.
Tải file test.txt cần chạy dự đoán tại đây
Định dạng file dự đoán
File dự đoán phải được đặt tên chính xác là predictions.txt. Đây là file văn bản thuần, gồm một nhãn dự đoán trên mỗi dòng, theo đúng thứ tự các câu trong test.txt. Mỗi nhãn là số nguyên từ 0 đến 4.
Ví dụ, nếu test.txt có hai câu thì nội dung predictions.txt có dạng:
4
2
Không ghi tiêu đề, dấu ngoặc hoặc lời giải thích vào file. Dòng trống và dòng bắt đầu bằng # được bỏ qua; mỗi dòng còn lại phải chứa đúng một nhãn hợp lệ.
Ràng buộc
- Độ dài câu: tối đa 200 từ.
- Câu đầu vào chỉ gồm văn bản thuần, có thể chứa dấu câu và ký tự đặc biệt.
- Nhãn dự đoán phải là số nguyên trong khoảng từ
0đến4. - File dự đoán phải có tên chính xác là
predictions.txt.
Đánh giá
- Điểm chính: Macro-F1 trên tập kiểm tra ẩn.
- Điểm phụ, dùng để phân hạng khi bằng điểm: Accuracy.
Giới hạn
- Cấm sử dụng trọng số tiền huấn luyện (pretrained weights).
- Trọng số mô hình phải nhỏ hơn 400M tham số.
- Được phép sử dụng dữ liệu bên ngoài, với điều kiện dữ liệu đó phải được public.
Dữ liệu huấn luyện
Tải dữ liệu huấn luyện gồm các file train.txt, train.labels, dev.txt và dev.labels tại đây:
Baseline
Mã nguồn baseline có thể tải tại đây:
Nộp bài
Nộp một file ZIP có tên chính xác là submission.zip. Bên trong ZIP phải có:
predictions.txt: một nhãn dự đoán trên mỗi dòng, theo đúng thứ tự các câu trongtest.txt.- Một file Python bất kỳ có đuôi
.py.
Ví dụ cấu trúc bên trong submission.zip:
submission.zip
├── predictions.txt
└── solution.py
Ví dụ
Dữ liệu đầu vào mẫu
An absolutely delightful film with a warm heart and sharp wit.
The plot drags in the middle, but the final act is watchable.
Nội dung file predictions.txt mẫu
4
2
Bình luận