Hessel De Wit
Số áo #75Midfielder
Netherlands
Câu lạc bộ hiện tại
AZ Alkmaar
Clubhouse
Thông tin chi tiết (Wikipedia)
| Một phần của loạt bài về |
| Học máy và khai phá dữ liệu |
|---|
Danh sách các bộ dữ liệu dùng trong nghiên cứu học máy bao gồm các tập dữ liệu được sử dụng trong nghiên cứu học máy và được mô tả hoặc sử dụng trong các công trình học thuật đã qua bình duyệt. Các bộ dữ liệu đóng vai trò quan trọng trong việc phát triển và đánh giá các thuật toán và mô hình học máy.
Các bộ dữ liệu trong danh sách được phân loại chủ yếu theo dạng dữ liệu mà mô hình xử lý, chẳng hạn như hình ảnh, video, văn bản, âm thanh, chuỗi thời gian, dữ liệu dạng bảng, đồ thị, dữ liệu ba chiều và dữ liệu đa phương thức kết hợp nhiều dạng khác nhau. Trong mỗi nhóm, chúng có thể được chia nhỏ theo nội dung hoặc lĩnh vực ứng dụng. Một bộ dữ liệu có thể hỗ trợ nhiều tác vụ học máy khác nhau, chẳng hạn như phân loại, hồi quy, phân vùng ảnh, phát hiện vật thể, xử lý ngôn ngữ tự nhiên, hệ thống gợi ý hoặc tổng quát hóa miền.
Trong các bộ dữ liệu dùng cho học có giám sát, mỗi mẫu dữ liệu thường đi kèm một hoặc nhiều nhãn (label) biểu thị thông tin mà mô hình cần dự đoán. Trong bài toán phân loại, mỗi giá trị phân loại có thể được gọi là một lớp (class); chẳng hạn, một bộ dữ liệu ảnh chó và mèo có hai lớp, còn nhãn của một ảnh cụ thể cho biết ảnh đó thuộc lớp nào. Một mẫu cũng có thể có nhiều nhãn cùng lúc, như một ảnh được gán đồng thời các nhãn "người", "ô tô" và "đường phố". Với các tác vụ khác, nhãn có thể mang dạng khác, chẳng hạn một giá trị số trong hồi quy, hộp giới hạn trong phát hiện vật thể, nhãn cho từng pixel trong phân vùng ảnh, hoặc một chuỗi văn bản trong các bài toán ngôn ngữ. Một số bộ dữ liệu không có nhãn có thể được sử dụng cho học không giám sát hoặc học tự giám sát.
Dữ liệu hình ảnh
Chữ viết tay và ký tự
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| MNIST | Ảnh đen trắng 28 × 28 pixel của các chữ số viết tay từ 0 đến 9. | 70.000 ảnh | Phân loại ảnh; nhận dạng chữ viết tay | 1998 | |
| USPS | Ảnh đen trắng của các chữ số viết tay được trích từ mã ZIP trên thư của Bưu điện Hoa Kỳ. | Khoảng 12.000 ảnh | Phân loại ảnh; nhận dạng chữ viết tay | 1992 | |
| CASIA-HWDB | Ảnh đen trắng của các ký tự và văn bản chữ Hán viết tay do hơn một nghìn người viết tạo ra. | Hơn 1 triệu ảnh ký tự | Phân loại ảnh; nhận dạng chữ viết tay; nhận dạng chữ Hán | 2013 | |
| Chars74K | Ảnh các ký tự tiếng Anh và chữ Kannada được thu thập từ cảnh tự nhiên, chữ viết tay và các phông chữ tổng hợp. | 74.107 ảnh | Nhận dạng ký tự; nhận dạng ký tự quang học; phân loại ảnh | 2009 | |
| EMNIST | Ảnh đen trắng 28 × 28 pixel của các chữ số và chữ cái viết tay, được tạo từ NIST Special Database 19 theo cùng định dạng với MNIST. | 814.255 ảnh trong tập ByClass | Phân loại ảnh; nhận dạng chữ viết tay; nhận dạng ký tự | 2017 | |
| Street View House Numbers (SVHN) | Ảnh màu của các chữ số trong số nhà được thu thập từ Google Street View, kèm nhãn và hộp giới hạn cho từng chữ số. | 630.420 chữ số | Nhận dạng chữ số; phân loại ảnh; phát hiện ký tự | 2011 | |
| Semeion Handwritten Digit | Ảnh nhị phân đã chuẩn hóa của các chữ số viết tay từ 0 đến 9 do 80 người viết tạo ra. | 1.593 ảnh | Phân loại ảnh; nhận dạng chữ viết tay | 2008 |
Vật thể
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Caltech 101 | Ảnh các vật thể thuộc 101 lớp, với phần lớn vật thể xuất hiện trên nền tương đối đồng nhất. | 9.146 ảnh; 101 lớp | Phân loại ảnh; nhận dạng vật thể | 2004 | |
| Caltech-256 | Ảnh các vật thể thuộc 256 lớp, với số lượng ảnh và mức độ đa dạng lớn hơn Caltech 101. | 30.607 ảnh; 256 lớp | Phân loại ảnh; nhận dạng vật thể | 2007 | |
| CIFAR-10 | Ảnh màu 32 × 32 pixel thuộc 10 lớp vật thể, được lấy từ bộ 80 Million Tiny Images. | 60.000 ảnh; 10 lớp | Phân loại ảnh | 2009 | |
| CIFAR-100 | Ảnh màu 32 × 32 pixel thuộc 100 lớp vật thể, được nhóm thành 20 siêu lớp. | 60.000 ảnh; 100 lớp | Phân loại ảnh; phân loại theo nhãn lớn và nhãn con | 2009 | |
| Fashion-MNIST | Ảnh đen trắng 28 × 28 pixel của các sản phẩm thời trang thuộc 10 lớp, theo cùng định dạng dữ liệu với MNIST. | 70.000 ảnh; 10 lớp | Phân loại ảnh | 2017 | |
| ImageNet | Ảnh thuộc hàng nghìn lớp vật thể được tổ chức theo hệ thống khái niệm phân cấp của WordNet. | 14.197.122 ảnh; 21.841 lớp, trong đó một tập hợp con gồm 1.000 lớp thường được sử dụng cho cuộc thi ILSVRC | Phân loại ảnh; phân loại theo nhãn lớn và nhãn con; phát hiện vật thể | 2009 | |
| SUN | Ảnh các cảnh trong nhà và ngoài trời thuộc nhiều lớp cảnh, kèm chú thích cho các vật thể xuất hiện trong ảnh. | 131.067 ảnh; 899 lớp | Nhận dạng cảnh; nhận dạng vật thể | 2010 | |
| LSUN | Ảnh thuộc 10 lớp cảnh và 20 lớp vật thể, được gán nhãn bằng quy trình kết hợp mô hình học sâu với chú thích của con người. | Khoảng 1 triệu ảnh có nhãn cho mỗi một trong 10 lớp cảnh; ngoài ra có 20 lớp vật thể | Phân loại ảnh; nhận dạng cảnh; nhận dạng vật thể | 2015 | |
| LabelMe | Ảnh các cảnh tự nhiên, trong đó các vật thể được người dùng chú thích bằng đa giác và nhãn văn bản. | 187.240 ảnh, trong đó 62.197 ảnh được chú thích. Tổng cộng 658.992 vật thể được chú thích | Nhận dạng vật thể; phát hiện vật thể; phân vùng ảnh; tổng quát hóa miền | 2008 | |
| Places | Ảnh các cảnh trong nhà và ngoài trời thuộc hơn 400 lớp địa điểm và cảnh. | Khoảng 10 triệu ảnh; hơn 400 lớp cảnh | Phân loại ảnh; nhận dạng cảnh | 2018 | |
| PASCAL VOC | Ảnh các cảnh tự nhiên chứa vật thể thuộc 20 lớp, kèm nhãn lớp, hộp giới hạn và mặt nạ phân vùng. | Hàng chục nghìn ảnh qua các phiên bản (2007: 9.963, 2012: 22.263, bản tổng hợp 21.503 ảnh lấy năm 2007 và một phần từ 2012); 20 lớp | Phân loại ảnh; phát hiện vật thể; phân vùng ảnh | 2010 | |
| Microsoft COCO | Ảnh các cảnh đời thường chứa nhiều vật thể trong bối cảnh tự nhiên, kèm chú thích lớp, hộp giới hạn và mặt nạ phân vùng cho từng vật thể. | Hơn 200.000 ảnh; hơn 1,5 triệu đối tượng | Phát hiện vật thể; phân vùng ảnh; ước lượng điểm mốc; tạo chú thích ảnh | 2014 | |
| Open Images | Ảnh thuộc hàng nghìn lớp vật thể, kèm nhãn cấp ảnh, hộp giới hạn, mặt nạ phân vùng và chú thích quan hệ giữa các vật thể. | Khoảng 9 triệu ảnh; 20.000 lớp và 600 vật thể có hộp giới hạn | Phân loại ảnh; phát hiện vật thể; phân vùng ảnh; phát hiện quan hệ trực quan | 2017 | |
| LVIS | Ảnh các cảnh tự nhiên chứa vật thể thuộc hơn một nghìn lớp, kèm mặt nạ phân vùng cho từng thực thể và có phân bố lớp đuôi dài. | 164.000 ảnh; khoảng 2,2 triệu mặt nạ; hơn 1.000 lớp | Phát hiện vật thể; phân vùng thực thể | 2019 | |
| VLCS | Ảnh thuộc năm lớp vật thể trong bốn miền dữ liệu: VOC2007, LabelMe, Caltech và SUN09. | Khoảng 10.700 ảnh; 4 miền; 5 lớp | Phân loại ảnh; tổng quát hóa miền | 2015 | |
| PACS | Ảnh thuộc bảy lớp vật thể trong bốn miền hình ảnh: ảnh chụp, tranh vẽ, hoạt hình và phác thảo. | 9.991 ảnh; 4 miền; 7 lớp | Phân loại ảnh; tổng quát hóa miền | 2017 | |
| Office-Home | Ảnh thuộc 65 lớp vật thể trong bốn miền hình ảnh: tranh vẽ, clipart, ảnh không nền và ảnh chụp. | Khoảng 15.500 ảnh; 4 miền; 65 lớp | Phân loại ảnh; thích nghi miền; tổng quát hóa miền | 2017 | |
| DomainNet | Ảnh thuộc 345 lớp vật thể trong sáu miền hình ảnh: clipart, đồ họa thông tin, tranh vẽ, hình vẽ từ "Quick, Draw!" của Google, ảnh chụp và phác thảo. | Khoảng 0,6 triệu ảnh; 6 miền; 345 lớp | Phân loại ảnh; thích nghi miền; tổng quát hóa miền | 2019 |
Khuôn mặt người
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| FERET | Ảnh khuôn mặt của nhiều người được chụp ở các thời điểm, tư thế và điều kiện khác nhau để đánh giá các thuật toán nhận dạng khuôn mặt. | 14.126 ảnh của 1.199 người | Nhận dạng khuôn mặt; xác minh danh tính | 1998 | |
| Yale Face Database | Ảnh khuôn mặt của 15 người dưới nhiều biểu cảm và điều kiện chiếu sáng khác nhau. | 165 ảnh; 15 người | Nhận dạng khuôn mặt; nhận dạng biểu cảm | 1997 | |
| Cohn–Kanade | Chuỗi ảnh khuôn mặt có gán nhãn các đơn vị hành động và biểu cảm, được thu thập để nghiên cứu phân tích biểu cảm khuôn mặt. | Hơn 500 chuỗi ảnh của 100 người | Nhận dạng biểu cảm; phát hiện đơn vị hành động | 2000 | |
| JAFFE | Ảnh khuôn mặt của 10 phụ nữ Nhật Bản thể hiện sáu biểu cảm cơ bản và trạng thái trung tính. | 213 ảnh | Nhận dạng biểu cảm khuôn mặt | 1998 | |
| BioID Face Database | Ảnh khuôn mặt chụp trong điều kiện thực tế, kèm tọa độ vị trí mắt được gán nhãn thủ công. | 1.521 ảnh của 23 người | Phát hiện khuôn mặt; định vị đặc trưng khuôn mặt | 2001 | |
| Labeled Faces in the Wild (LFW) | Ảnh khuôn mặt của người nổi tiếng và nhân vật công chúng được thu thập từ Internet trong các điều kiện không kiểm soát. | 13.233 ảnh của 5.749 người | Nhận dạng khuôn mặt; xác minh khuôn mặt | 2007 | |
| SCFace | Ảnh khuôn mặt được chụp đồng thời bằng máy ảnh chất lượng cao và nhiều camera giám sát ở các khoảng cách khác nhau. | 4.160 ảnh của 130 người | Nhận dạng khuôn mặt; nhận dạng khuôn mặt từ camera giám sát | 2011 | |
| FaceScrub | Ảnh khuôn mặt của các nhân vật công chúng được thu thập tự động từ kết quả tìm kiếm ảnh trên Internet. | 106.863 ảnh của 530 người | Nhận dạng khuôn mặt | 2014 | |
| Leeds Sports Pose | Ảnh người trong các hoạt động thể thao, với vị trí 14 khớp cơ thể được gán nhãn cho chủ thể chính trong ảnh. | 2.000 ảnh | Ước lượng tư thế người | 2010 | |
| Leeds Sports Pose Extended | Ảnh người trong các hoạt động thể thao được thu thập từ Flickr, với vị trí 14 khớp cơ thể được gán nhãn; đây là phần mở rộng của Leeds Sports Pose. | 10.000 ảnh | Ước lượng tư thế người | 2011 |
Y khoa
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Messidor | Ảnh màu đáy mắt với nhãn mức độ bệnh võng mạc tiểu đường và nguy cơ phù hoàng điểm. | 1.200 ảnh | Phân loại ảnh; phân vùng ảnh; phát hiện bệnh võng mạc tiểu đường | 2008 | |
| Synthetic Fundus Dataset | Ảnh đáy mắt tổng hợp có tính quang thực cùng mặt nạ phân vùng mạch máu võng mạc. | 2.500 ảnh | Phân vùng mạch máu; phân loại ảnh | 2020 | |
| ChestX-ray14 | Ảnh X-quang ngực nhìn từ phía trước của bệnh nhân tại NIH Clinical Center, với 14 nhãn phát hiện bệnh lý được suy ra từ báo cáo X-quang. | 112.120 ảnh của 30.805 bệnh nhân | Phân loại ảnh đa nhãn; định vị bất thường | 2017 | |
| HAM10000 | Ảnh soi da cho các tổn thương sắc tố da, gồm bảy nhóm chẩn đoán khác nhau. | 10.015 ảnh | Phân loại tổn thương da; phát hiện u hắc tố | 2018 | |
| CheXpert | Ảnh X-quang ngực với 14 nhãn quan sát lâm sàng, gồm cả nhãn không chắc chắn được suy ra từ báo cáo X-quang. | 224.316 ảnh của 65.240 bệnh nhân | Phân loại ảnh đa nhãn; phát hiện bất thường | 2019 | |
| CAMELYON17 | Ảnh toàn bộ tiêu bản mô học của các hạch bạch huyết nhuộm H&E từ bệnh nhân ung thư vú tại năm trung tâm y tế, kèm chú thích di căn. | 1.000 ảnh toàn bộ tiêu bản | Phát hiện di căn; phân loại ảnh; tổng quát hóa miền | 2017 | |
| VinDr-CXR | Ảnh X-quang ngực từ các bệnh viện ở Việt Nam, được bác sĩ X-quang gán nhãn cho các phát hiện và chẩn đoán bất thường. | 18.000 ảnh | Phân loại ảnh; phát hiện và định vị bất thường | 2022 | |
| AlphaDent | Ảnh chụp răng với độ phân giải cao bằng máy ảnh DSLR, được gán nhãn các bệnh lý và phục hình nha khoa bằng mặt nạ thực thể để phân vùng. | 1.320 ảnh; 9 lớp | Phân vùng thực thể; phát hiện bệnh lý răng | 2025 |
Động vật và thực vật
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Oxford 17 Flowers | Ảnh của 17 loài hoa phổ biến ở Vương quốc Anh, với mỗi lớp gồm 80 ảnh. | 1.360 ảnh; 17 lớp | Phân loại loài | 2006 | |
| Oxford 102 Flowers | Ảnh của 102 loài hoa, với sự biến thiên lớn về kích thước, tư thế và điều kiện chiếu sáng. | 8.189 ảnh; 102 lớp | Phân loại loài | 2008 | |
| CUB-200-2011 | Ảnh của 200 loài chim tại Bắc Mỹ với chú thích lớp, hộp giới hạn, vị trí các bộ phận và các thuộc tính hình thái của loài. | 11.788 ảnh; 200 loài | Phân loại loài; định vị bộ phận | 2011 | |
| Stanford Dogs | Ảnh của 120 giống chó trên thế giới, được xây dựng từ ảnh và chú thích của ImageNet. | 20.580 ảnh; 120 giống | Phân loại giống | 2011 | |
| Oxford-IIIT Pet | Ảnh của 37 giống chó và mèo với chú thích giống, vùng đầu và mặt nạ phân vùng cho mỗi pixel. | 7.349 ảnh; 37 giống | Phân loại giống; phân vùng ảnh | 2012 | |
| Folio | Ảnh lá cây của 32 loài thực vật được chụp dưới nhiều điều kiện khác nhau. | 637 ảnh; 32 loài | Phân loại loài | 2015 | |
| Snapshot Serengeti | Ảnh lấy từ các bẫy ảnh được thu thập liên tục tại Vườn quốc gia Serengeti để khảo sát các loài động vật có vú trong môi trường tự nhiên. | Khoảng 1,2 triệu tập ảnh từ 225 bẫy ảnh | Phát hiện động vật; phân loại loài; giám sát đa dạng sinh học | 2015 | |
| Plant Seedlings Dataset | Ảnh cây con của 12 loài cây trồng và cỏ dại ở nhiều giai đoạn sinh trưởng. | Khoảng 5.500 ảnh; 12 loài | Phân loại loài | 2017 | |
| iNaturalist 2017 | Ảnh thực địa về thực vật và động vật có phân bố lớp mất cân bằng tự nhiên, được thu thập từ cộng đồng iNaturalist. | 859.000 ảnh; hơn 5.000 loài | Phân loại loài; nhận dạng loài | 2018 | |
| Terra Incognita | Ảnh động vật được thu thập từ 20 bẫy ảnh cố định tại các địa điểm khác nhau, được thiết kế để đánh giá khả năng nhận dạng động vật ở các môi trường mà mô hình chưa từng học. | Hơn 24.000 ảnh trong benchmark thường dùng | Phân loại loài; phát hiện động vật; tổng quát hóa miền | 2018 |
Ảnh viễn thám
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| UC Merced Land Use | Ảnh hàng không với độ phân giải cao cho các khu vực tại Hoa Kỳ, được chia thành 21 lớp cho các mục đích sử dụng đất như khu dân cư, rừng, đường cao tốc và sân bay. | 2.100 ảnh; 21 lớp | Phân loại sử dụng đất | 2010 | |
| SAT-4 | Ảnh hàng không từ chương trình National Agriculture Imagery Program của Hoa Kỳ, được chia thành bốn lớp phủ bề mặt. | 500.000 ảnh; 4 lớp | Phân loại lớp phủ bề mặt | 2015 | |
| SAT-6 | Ảnh hàng không từ cùng nguồn với SAT-4, được chia thành sáu lớp phủ bề mặt. | 405.000 ảnh; 6 lớp | Phân loại lớp phủ bề mặt | 2015 | |
| AID | Ảnh viễn thám thu thập từ nhiều quốc gia và điều kiện chụp khác nhau, bao gồm 30 loại cảnh như sân bay, khu dân cư, rừng và cảng biển. | 10.000 ảnh; 30 lớp | Phân loại cảnh viễn thám | 2017 | |
| NWPU-RESISC45 | Ảnh viễn thám thuộc 45 loại cảnh, với sự biến thiên về độ phân giải, góc nhìn, ánh sáng và điều kiện nền. | 31.500 ảnh; 45 lớp | Phân loại cảnh viễn thám | 2017 | |
| INRIA Aerial Image Labeling | Ảnh hàng không độ phân giải 0,3 m từ nhiều thành phố tại Hoa Kỳ và châu Âu, kèm mặt nạ nhị phân thể hiện có công trình nhân tạo ở đó không. | 360 ảnh 5.000 × 5.000 pixel | Phân vùng công trình | 2017 | |
| SpaceNet 2: Building Detection v2 | Ảnh vệ tinh WorldView-3 độ phân giải cao tại các thành phố Las Vegas, Paris, Thượng Hải và Khartoum, kèm các đa giác vị trí các công trình nhân tạo. | 24.586 cảnh ảnh; 4 khu vực | Phát hiện công trình; phân vùng công trình; trích xuất dấu chân công trình | 2017 | |
| DOTA | Ảnh hàng không độ phân giải cao từ nhiều cảm biến và nền tảng, với các vật thể xuất hiện ở nhiều kích thước và hướng khác nhau. | 2.806 ảnh; 15 lớp trong phiên bản đầu | Phát hiện vật thể | 2018 | |
| MASATI | Ảnh quang học trên không của các vùng biển và ven biển trong nhiều điều kiện thời tiết và chiếu sáng, bao gồm cả ảnh có và không có tàu. | 7.389 ảnh | Phân loại cảnh hàng hải; phát hiện tàu | 2018 | |
| AICrowd Mapping Challenge | Ảnh vệ tinh RGB WorldView-3 độ phân giải 0,3 m được chia thành các mảnh 300 × 300 pixel, kèm chú thích đa giác dấu chân công trình theo định dạng MS COCO. Bộ dữ liệu được tạo từ dữ liệu SpaceNet 2.
Một nghiên cứu tại CVPR 2026 phát hiện mức độ trùng lặp và rò rỉ dữ liệu nghiêm trọng: sau khi loại các bản sao chính xác và biến đổi, chỉ còn 29.338 ảnh huấn luyện duy nhất trong số 280.741 ảnh ban đầu, đồng thời 93,45% ảnh kiểm định xuất hiện trong tập huấn luyện. |
280.741 ảnh huấn luyện; 60.317 ảnh kiểm định; 60.697 ảnh kiểm tra | Phân vùng công trình; trích xuất dấu chân công trình | 2018 | |
| DeepGlobe | Ảnh vệ tinh độ phân giải cao từ nhiều khu vực trên thế giới, được gán nhãn cho ba bài toán gồm trích xuất đường giao thông, phát hiện tòa nhà và phân vùng các lớp phủ đất như khu đô thị, đất nông nghiệp, rừng, mặt nước và đất cằn. | 3 bộ dữ liệu; riêng bộ trích xuất đường gồm 8.570 ảnh phủ khoảng 2.220 km² | Trích xuất đường; phát hiện tòa nhà; phân vùng lớp phủ đất | 2018 | |
| Functional Map of the World | Ảnh vệ tinh đa phổ của các địa điểm tại hơn 200 quốc gia và vùng lãnh thổ, kèm thông tin về vị trí, thời gian chụp và điều kiện quan sát. Các địa điểm được chia thành 63 lớp theo chức năng, như sân bay, bệnh viện, nhà máy điện, cảng, nhà tù và cơ sở quân sự. | 1.047.691 ảnh; 63 lớp; 207 quốc gia hoặc vùng lãnh thổ | Phân loại chức năng địa điểm; nhận dạng địa điểm từ ảnh viễn thám | 2018 | |
| xView | Ảnh vệ tinh WorldView-3 với độ phân giải khoảng 0,3 m, bao phủ nhiều khu vực trên thế giới và được gán hộp giới hạn cho 60 loại vật thể như máy bay, tàu thủy, ô tô, xe tải, tòa nhà và các cơ sở hạ tầng khác. | Hơn 1 triệu vật thể; 60 lớp; hơn 1.400 km² ảnh | Phát hiện vật thể | 2018 | |
| EuroSAT | Ảnh vệ tinh Sentinel-2 được chia thành 10 lớp sử dụng đất và lớp phủ bề mặt; phiên bản đa phổ sử dụng 13 dải phổ. | 27.000 ảnh; 10 lớp | Phân loại sử dụng đất; phân loại lớp phủ bề mặt | 2019 | |
| iSAID | Bộ dữ liệu được xây dựng từ ảnh DOTA và bổ sung mặt nạ cho từng vật thể trong ảnh. | 2.806 ảnh; 655.451 đối tượng; 15 lớp | Phân vùng thực thể | 2019 | |
| BigEarthNet | Ảnh vệ tinh đa phổ từ Sentinel-2 được thu thập tại mười quốc gia châu Âu, bao phủ nhiều điều kiện theo mùa và địa lý. Mỗi ảnh được gán nhiều nhãn lớp phủ đất dựa trên hệ thống CORINE Land Cover, như đất canh tác, rừng, đồng cỏ, vùng đô thị và mặt nước. | 590.326 ảnh; 19 lớp trong hệ nhãn được sửa đổi | Phân loại đa nhãn lớp phủ đất | 2019 | |
| xBD | Các cặp ảnh vệ tinh độ phân giải cao chụp cùng khu vực trước và sau thiên tai, kèm vị trí tòa nhà và mức độ thiệt hại. Dữ liệu bao gồm nhiều loại sự kiện như động đất, lũ lụt, cháy rừng, bão nhiệt đới và sóng thần tại nhiều quốc gia. | 850.736 chú thích tòa nhà; 45.362 km² ảnh | Phát hiện thay đổi; đánh giá thiệt hại tòa nhà | 2019 | |
| LoveDA | Ảnh viễn thám độ phân giải cao từ Nam Kinh, Thường Châu và Vũ Hán tại Trung Quốc, bao gồm cả khu vực đô thị và nông thôn. Mỗi pixel được gán một trong bảy lớp như tòa nhà, đường, mặt nước, rừng, đất nông nghiệp và đất trống. | 5.987 ảnh; 7 lớp | Phân vùng lớp phủ đất; thích nghi miền | 2021 | |
| Million-AID | Ảnh viễn thám độ phân giải cao thu thập trên phạm vi toàn cầu, bao gồm các cảnh tự nhiên và nhân tạo như đất nông nghiệp, rừng, khu dân cư, sân bay, cảng, cầu và các cơ sở công nghiệp. Các ảnh được tổ chức theo một hệ phân cấp gồm 51 loại cảnh. | Hơn 1 triệu ảnh; 51 lớp | Phân loại cảnh viễn thám | 2021 | |
| Harmonized Landsat Sentinel-2 | Ảnh vệ tinh phản xạ bề mặt từ Landsat 8, Landsat 9 và Sentinel-2 được hiệu chỉnh và chuẩn hóa để có thể sử dụng chung. Dữ liệu phủ gần toàn bộ đất liền trên thế giới ở độ phân giải 30 m và cung cấp các quan sát lặp lại theo thời gian cho những ứng dụng như theo dõi thảm thực vật, nông nghiệp và thay đổi lớp phủ đất. | Phủ gần toàn bộ đất liền toàn cầu trừ Nam Cực; độ phân giải 30 m; dữ liệu từ năm 2013 | Phân loại lớp phủ đất; phát hiện thay đổi; giám sát nông nghiệp và thảm thực vật; phân tích chuỗi ảnh viễn thám | 2025 |
Giao thông
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| German Traffic Sign Recognition Benchmark (GTSRB) | Ảnh biển báo giao thông tại Đức thuộc 43 lớp, được thu thập từ các chuỗi video thực tế và cắt thành từng ảnh biển báo riêng lẻ. | 51.840 ảnh; 43 lớp | Phân loại biển báo giao thông | 2011 | |
| German Traffic Sign Detection Benchmark (GTSDB) | Ảnh cảnh đường phố tại Đức với các biển báo giao thông được đánh dấu bằng hộp giới hạn. | 900 ảnh | Phát hiện biển báo giao thông | 2013 | |
| Daimler Monocular Pedestrian Detection | Ảnh chụp từ camera đơn trên xe chạy trong môi trường đô thị, với vị trí người đi bộ được đánh dấu bằng hộp giới hạn. | Hàng chục nghìn mẫu huấn luyện; hơn 21.000 ảnh kiểm tra | Phát hiện người đi bộ | 2009 | |
| CamVid | Các frame từ video quay khi lái xe ở Cambridge, với từng pixel được gán một trong 32 lớp ngữ nghĩa như đường xá, xe cộ, người đi bộ và công trình. | Hơn 700 frame được gán nhãn | Phân vùng ngữ nghĩa cảnh đường phố | 2009 | |
| Cityscapes | Ảnh đường phố được trích từ các chuỗi video stereo được ghi lại tại 50 thành phố, với nhãn ngữ nghĩa và nhãn thực thể cho từng pixel. | 5.000 ảnh gán nhãn chi tiết; 20.000 ảnh gán nhãn thô | Phân vùng ngữ nghĩa; phân vùng thực thể | 2016 | |
| Bosch Small Traffic Lights Dataset | Ảnh đường phố thu từ camera trên xe, với hộp giới hạn và trạng thái hoạt động của từng đèn tín hiệu giao thông. | 13.427 ảnh; khoảng 24.000 đèn tín hiệu được gán nhãn | Phát hiện đèn tín hiệu; phân loại trạng thái đèn | 2017 | |
| RailSem19 | Các frame nhìn từ buồng lái tàu hỏa và tàu điện, được gán nhãn cho mỗi pixel cho cảnh đường sắt và các đối tượng liên quan. | 8.500 frame được chú thích | Phân vùng ngữ nghĩa cảnh đường sắt | 2019 | |
| RAWPED | Ảnh đường sắt ghi từ phương tiện chạy trên đường ray, với người đi bộ được đánh dấu bằng hộp giới hạn. | 26.000 ảnh | Phát hiện người đi bộ trên đường sắt | 2020 | |
| FRSign | Ảnh chụp từ tàu đang vận hành tại Pháp, với hộp giới hạn và trạng thái của các đèn tín hiệu đường sắt. | Hơn 100.000 ảnh trong phần dữ liệu được công bố | Phát hiện tín hiệu đường sắt; phân loại trạng thái tín hiệu | 2020 | |
| GERALD | Ảnh cảnh đường sắt tại Đức với các tín hiệu đường sắt chính tuyến và các biển báo liên quan được gán hộp giới hạn. | 5.000 ảnh; 33.554 đối tượng được gán nhãn | Phát hiện tín hiệu đường sắt | 2023 | |
| RailFOD23 | Ảnh các vật thể lạ xuất hiện trên hệ thống truyền tải điện đường sắt, gồm túi nhựa, các vật thể trong không trung, tổ chim và bóng bay. | 14.615 ảnh; 40.541 đối tượng được gán nhãn | Phát hiện vật thể lạ | 2024 |
Robot và thao tác vật thể
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Cornell Grasping Dataset | Ảnh RGB-D (D cho độ sâu) của các vật thể, trong đó mỗi vật thể được chú thích bằng nhiều cách gắp khả thi và không khả thi. Một tư thế gắp được biểu diễn bằng hình chữ nhật có hướng trên ảnh, tương ứng với vị trí và hướng của kẹp robot. | 885 ảnh RGB-D; 240 vật thể; 8.019 tư thế gắp được chú thích | Phát hiện tư thế gắp | 2011 | |
| Jacquard | Bộ dữ liệu tổng hợp được tạo từ các mô hình vật thể 3D, cung cấp ảnh RGB, ảnh độ sâu và mặt nạ phân vùng của từng cảnh. Các tư thế gắp khả thi được xác định bằng mô phỏng và biểu diễn trên mặt phẳng ảnh. | 54.485 cảnh; 11.619 vật thể; 4.967.454 chú thích tư thế gắp | Phát hiện tư thế gắp | 2018 |
Khác
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| FAMOS | Ảnh hiển vi của 5.000 vi cấu trúc vật lý riêng biệt; mỗi mẫu được chụp nhiều lần bằng hai camera khác nhau để nghiên cứu khả năng xác thực dựa trên các đặc trưng vật lý khó sao chép. | 30.000 ảnh; 5.000 mẫu | Xác thực; nhận dạng mẫu | 2012 | |
| PharmaPack | Ảnh bao bì dược phẩm thuộc 1.000 sản phẩm khác nhau, được chụp trong nhiều điều kiện và góc nhìn để phân biệt các bao bì có hình thức tương tự nhau. | 54.000 ảnh; 1.000 lớp | Phân loại sản phẩm; nhận dạng bao bì dược phẩm | 2017 | |
| MCQ Dataset | Ảnh phiếu trả lời của sáu bài kiểm tra trắc nghiệm thực tế, kèm vị trí và nhãn của các ô trả lời để đánh giá các hệ thống chấm bài tự động bằng thị giác máy tính. | 735 phiếu trả lời; 33.540 ô trả lời | Nhận dạng đáp án; chấm bài trắc nghiệm tự động | 2017 |
Dữ liệu video
Hành động và hoạt động của con người
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| HMDB51 | Các đoạn video ngắn về chuyển động và hành động của con người, được thu thập từ phim, video trên Internet và nhiều nguồn khác. | 6.766 đoạn video; 51 lớp hành động | Nhận dạng hành động | 2011 | |
| UCF101 | Các đoạn video thực tế được thu thập từ YouTube, bao gồm nhiều loại hành động của con người như thể thao, tương tác với đồ vật và tương tác giữa người với người. | 13.320 đoạn video; 101 lớp hành động; khoảng 27 giờ video | Nhận dạng hành động | 2012 | |
| MPII Cooking Activities | Video quay các hoạt động nấu ăn trong nhà bếp. Các thao tác được chú thích theo từng khoảng thời gian, cho phép xác định những hành động cụ thể. | 44 video; 65 lớp hoạt động; 881.755 frame | Nhận dạng hành động; xác định hành động theo thời gian | 2012 | |
| ActivityNet | Video chưa được cắt thành các đoạn hành động riêng, bao gồm nhiều hoạt động phức tạp trong đời sống thường ngày. Các khoảng thời gian chứa hoạt động được chú thích trong từng video. | Khoảng 20.000 video; 200 lớp hoạt động; hơn 600 giờ video | Phân loại hoạt động; xác định hoạt động theo thời gian | 2015 | |
| Charades | Video do người tham gia tự quay tại nhà khi thực hiện các hoạt động thường ngày. Mỗi video có thể chứa nhiều hành động đồng thời hoặc nối tiếp nhau, kèm mô tả bằng ngôn ngữ tự nhiên và khoảng thời gian của từng hành động. | 9.848 video; 157 lớp hành động; 66.500 khoảng hành động được chú thích | Nhận dạng nhiều hành động; xác định hành động theo thời gian | 2016 | |
| Kinetics-400 | Các đoạn video khoảng 10 giây từ YouTube, tập trung vào hành động của con người và bao gồm cả tương tác với đồ vật lẫn tương tác giữa người với người. | Khoảng 300.000 đoạn video; 400 lớp hành động | Nhận dạng hành động | 2017 | |
| Something-Something | Video ngắn quay người thực hiện các tương tác đơn giản với đồ vật. Nhãn được xây dựng để phân biệt các hành động có hình ảnh tĩnh tương tự nhau nhưng khác về chuyển động hoặc quan hệ theo thời gian, chẳng hạn đặt vật lên trên hoặc lấy vật ra khỏi vật khác. | Hơn 100.000 video; 174 lớp trong phiên bản đầu | Nhận dạng hành động; hiểu tương tác người–vật | 2017 | |
| AVA | Các đoạn phim dài được chú thích cho nhiều hành động cơ bản của từng người. Tại các thời điểm được lấy mẫu, mỗi người được đánh dấu bằng hộp giới hạn và có thể mang đồng thời nhiều nhãn hành động. | 430 đoạn video dài 15 phút; 80 lớp hành động; khoảng 1,58 triệu nhãn hành động | Phát hiện hành động trong không gian và thời gian; nhận dạng nhiều hành động | 2018 | |
| HAA500 | Các đoạn video được chọn và chú thích thủ công để biểu diễn 500 hành động tương đối cụ thể của con người, bao gồm thể thao, sinh hoạt thường ngày và tương tác với đồ vật. | 10.000 video; 500 lớp hành động; hơn 591.000 frame được gán nhãn | Nhận dạng hành động | 2021 |
Khuôn mặt và biểu cảm
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| CASIA NIR | Các đoạn video khuôn mặt được ghi lại trong phổ ánh sáng khả kiến và cận hồng ngoại, với sáu biểu cảm gồm tức giận, ghê tởm, sợ hãi, vui vẻ, buồn bã và ngạc nhiên. | 480 chuỗi video | Nhận dạng biểu cảm khuôn mặt | 2011 | |
| Aff-Wild | Video khuôn mặt thu thập trong các điều kiện tự nhiên, với sự thay đổi về tư thế đầu, ánh sáng, sự che khuất và biểu cảm. Mỗi frame được chú thích bằng hai giá trị liên tục biểu diễn mức độ tích cực–tiêu cực của cảm xúc và cường độ cảm xúc. | 298 video; 200 người; hơn 30 giờ video | Ước lượng cảm xúc theo hai chiều valence–arousal | 2017 | |
| Aff-Wild2 | Bản mở rộng của Aff-Wild, gồm video khuôn mặt trong điều kiện tự nhiên và nhiều loại chú thích cảm xúc. Dữ liệu được chú thích theo biểu cảm rời rạc, hai chiều tích cực tiêu cực và cường độ, và các đơn vị hành động trên khuôn mặt. | Hơn 500 video; khoảng 2,8 triệu frame được chú thích | Nhận dạng biểu cảm; ước lượng valence–arousal; phát hiện đơn vị hành động khuôn mặt | 2019 | |
| FERV39k | Các đoạn video khuôn mặt thu thập từ nhiều cảnh thực tế như phim ảnh, chương trình truyền hình và video trên Internet. Mỗi đoạn được gán một trong bảy biểu cảm cơ bản. | 38.935 đoạn video; 7 lớp biểu cảm | Nhận dạng biểu cảm khuôn mặt trong video | 2022 |
Giao thông
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| UA-DETRAC | Các video giao thông quay bằng camera cố định tại nhiều địa điểm, trong các điều kiện thời tiết và mật độ giao thông khác nhau. Phương tiện trong mỗi frame được đánh dấu bằng hộp giới hạn và mã định danh để có thể theo dõi chúng qua thời gian. | 100 video; hơn 140.000 frame | Phát hiện phương tiện; theo dõi nhiều phương tiện | 2020 | |
| CityFlow | Video với độ phân giải cao được đồng bộ từ nhiều camera giao thông tại các nút giao thông trong cùng một thành phố. Các phương tiện được theo dõi giữa nhiều camera, cho phép xác định cùng một phương tiện khi nó xuất hiện tại các vị trí khác nhau. | Hơn 3 giờ video; 40 camera tại 10 nút giao; hơn 200.000 hộp giới hạn | Theo dõi phương tiện qua nhiều camera; tái nhận dạng phương tiện | 2019 | |
| BDD100K | Video quay từ camera phía trước của xe khi lưu thông trong nhiều thành phố, thời tiết và thời điểm trong ngày khác nhau. Bộ dữ liệu hỗ trợ nhiều loại chú thích, gồm phương tiện và người đi bộ, làn đường, vùng có thể lái xe và thông tin theo dõi đối tượng. | 100.000 video, mỗi video dài khoảng 40 giây; hơn 100 triệu frame | Phát hiện và theo dõi đối tượng; phân vùng cảnh đường phố; phát hiện làn đường | 2020 |
Video góc nhìn thứ nhất
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| EGTEA Gaze+ | Video góc nhìn thứ nhất (egocentric) ghi lại các hoạt động nấu ăn của người tham gia. Ngoài video, bộ dữ liệu còn cung cấp vị trí ánh nhìn, nhãn hành động và mặt nạ bàn tay cho một số frame. | 86 video; khoảng 28 giờ; 10.321 đoạn hành động; 106 lớp hành động | Nhận dạng và dự đoán hành động; dự đoán hướng nhìn | 2018 | |
| EPIC-KITCHENS-100 | Video góc nhìn thứ nhất ghi bằng camera đeo trên đầu khi người tham gia thực hiện các hoạt động thường ngày trong nhà bếp. Các đoạn hành động được chú thích bằng động từ và danh từ biểu thị thao tác và vật thể liên quan. | 700 video; 100 giờ; khoảng 20 triệu frame; 89.977 đoạn hành động | Nhận dạng hành động; phát hiện hành động theo thời gian; dự đoán hành động sắp xảy ra | 2020 | |
| Charades-Ego | Các cặp video quay cùng loại hoạt động trong nhà từ góc nhìn của người hành động và góc nhìn của người quan sát. Thiết kế này cho phép nghiên cứu mối liên hệ giữa cách một hành động xuất hiện đối với người thực hiện và đối với người quan sát bên ngoài. | 4.000 cặp video; 112 người; 157 lớp hành động | Nhận dạng hành động; chuyển giao giữa góc nhìn thứ nhất và góc nhìn người quan sát | 2018 | |
| Ego4D | Video góc nhìn thứ nhất về các hoạt động thường ngày trong gia đình, nơi làm việc, hoạt động ngoài trời và giải trí, được thu thập tại nhiều quốc gia. Bộ dữ liệu cung cấp nhiều benchmark cho việc hiểu hoạt động, tương tác với vật thể và diễn biến của các sự kiện dài. | 3.670 giờ video; 931 người đeo camera; 74 địa điểm tại 9 quốc gia | Nhận dạng và dự đoán hoạt động; tìm kiếm sự kiện trong video; hiểu tương tác người–vật | 2022 |
Khác
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| DAVIS | Các chuỗi video Full HD về nhiều vật thể và cảnh khác nhau, bao gồm các trường hợp bị che khuất, nhòe do chuyển động và thay đổi hình dạng. Mỗi frame có mặt nạ phân vùng thủ công cho vật thể cần theo dõi. | 50 video trong phiên bản đầu | Phân vùng vật thể trong video | 2016 | |
| YouTube-8M | Video YouTube thuộc nhiều chủ đề khác nhau, được gán đồng thời nhiều nhãn mô tả nội dung như vật thể, hoạt động và địa điểm. Bộ dữ liệu cũng cung cấp các đặc trưng hình ảnh và âm thanh được trích sẵn từ video. | Khoảng 8 triệu video; khoảng 500.000 giờ video; hơn 4.800 nhãn trong phiên bản đầu | Phân loại video đa nhãn | 2016 | |
| LIRIS-ACCEDE | Các đoạn phim được chú thích theo mức độ tích cực–tiêu cực của cảm xúc và cường độ cảm xúc mà nội dung video gây ra cho người xem. Khác với các bộ nhận dạng biểu cảm khuôn mặt, nhãn ở đây mô tả cảm xúc do toàn bộ nội dung video gợi ra. | 9.800 đoạn video trong bộ rời rạc; khoảng 27 giờ video | Phân tích cảm xúc do nội dung video gợi ra | 2015 | |
| YouTube-VOS | Video YouTube chứa nhiều loại vật thể và hoạt động, trong đó các vật thể được chú thích bằng mặt nạ phân vùng qua nhiều frame liên tiếp. Tập kiểm tra còn chứa các loại vật thể không xuất hiện trong tập huấn luyện để đánh giá khả năng khái quát sang lớp mới. | 3.252 video trong phiên bản công bố ban đầu; 78 loại vật thể; 133.886 chú thích vật thể | Phân vùng vật thể trong video | 2018 |
Dữ liệu 3D và đám mây điểm (point cloud)
Vật thể 3D
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| ModelNet | Các mô hình CAD 3D của những vật thể thông dụng trong nhà, được tổ chức theo lớp vật thể. Hai tập con ModelNet10 và ModelNet40 thường được dùng làm benchmark. | 12.311 mô hình trong ModelNet40; 40 lớp | Phân loại vật thể 3D; truy hồi mô hình 3D | 2015 | |
| ShapeNet | Các mô hình CAD 3D thuộc nhiều loại vật thể, được tổ chức theo hệ thống phân loại của WordNet. Nhiều mô hình còn có các chú thích về bộ phận, kích thước, hướng chuẩn và các thuộc tính hình học khác. | Hơn 3 triệu mô hình được lập chỉ mục; khoảng 220.000 mô hình được phân loại vào 3.135 lớp tại thời điểm công bố | Phân loại vật thể 3D; phân vùng bộ phận; truy hồi và tái tạo hình dạng 3D | 2015 | |
| ShapeNetPart | Tập con của ShapeNet trong đó các mô hình vật thể được chú thích theo từng bộ phận cấu thành, chẳng hạn cánh máy bay, chân ghế hoặc tay cầm. | 16.881 mô hình; 16 lớp vật thể; 50 loại bộ phận | Phân vùng bộ phận của vật thể 3D | 2016 | |
| ABC | Các mô hình CAD của các vật thể cơ khí được thu thập từ các tệp thiết kế tham số, kèm các bề mặt và đường cong hình học chính xác thay vì chỉ lưới tam giác xấp xỉ. | Hơn 1 triệu mô hình CAD | Tái tạo bề mặt; phân vùng hình học; học biểu diễn hình dạng 3D | 2019 | |
| OmniObject3D | Các vật thể đời thường thực được quét ở độ phân giải cao. Mỗi vật thể có mô hình lưới có kết cấu, đám mây điểm và nhiều góc quan sát, thay vì chỉ sử dụng các mô hình CAD tổng hợp. | 6.000 vật thể; 190 lớp | Phân loại vật thể 3D; tái tạo vật thể; sinh mô hình 3D | 2023 |
Khuôn mặt 3D
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Face Recognition Grand Challenge (FRGC) v2.0 | Ảnh khuôn mặt độ phân giải cao và các bản quét khuôn mặt 3D được thu thập trong nhiều phiên chụp. Phần dữ liệu 3D gồm bề mặt khuôn mặt và ảnh màu tương ứng. | 4.950 bản quét 3D; 466 người | Nhận dạng và xác minh khuôn mặt 3D | 2005 | |
| BU-3DFE | Các mô hình khuôn mặt 3D có kết cấu của 100 người, gồm biểu cảm trung tính và sáu biểu cảm cơ bản ở nhiều mức cường độ khác nhau. | 2.500 mô hình khuôn mặt; 100 người; 6 biểu cảm cơ bản | Nhận dạng biểu cảm khuôn mặt 3D | 2006 | |
| Bosphorus | Các bản quét khuôn mặt 3D có kết cấu, được thu thập với nhiều biểu cảm, góc quay đầu và dạng che khuất như kính mắt, tóc hoặc bàn tay. | 4.666 bản quét; 105 người | Nhận dạng khuôn mặt 3D; nhận dạng biểu cảm; đánh giá khả năng chống che khuất và thay đổi tư thế | 2008 | |
| FaceScape | Các mô hình khuôn mặt 3D có kết cấu và độ chi tiết cao, trong đó mỗi người được quét với nhiều biểu cảm. Các mô hình được xử lý để có cấu trúc lưới thống nhất, phục vụ việc tái tạo và mô hình hóa khuôn mặt 3D. | 18.760 mô hình khuôn mặt; 938 người; 20 biểu cảm | Tái tạo khuôn mặt 3D; mô hình hóa hình dạng và biểu cảm khuôn mặt | 2020 |
Giao thông
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| SemanticKITTI | Các chuỗi đám mây điểm LiDAR 360° từ KITTI Vision Odometry Benchmark, trong đó mỗi điểm được gán nhãn ngữ nghĩa cho các thành phần của cảnh giao thông như đường, xe, người và thảm thực vật. | 22 chuỗi; hơn 43.000 lần quét LiDAR | Phân vùng ngữ nghĩa đám mây điểm; phân vùng theo chuỗi thời gian | 2019 | |
| Rail3D | Đám mây điểm LiDAR của các tuyến đường sắt tại Hungary, Pháp và Bỉ, được gán nhãn cho các vật thể như đường ray, cột điện, dây điện, hàng rào và công trình. | Khoảng 288 triệu điểm; khoảng 5,8 km đường sắt; 9 lớp | Phân vùng ngữ nghĩa đám mây điểm đường sắt | 2024 | |
| WHU-Railway3D | Đám mây điểm LiDAR đường sắt tại Trung Quốc, bao gồm môi trường đô thị, nông thôn và cao nguyên, với nhãn cho từng điểm cùng các thuộc tính như cường độ phản xạ và góc quét. | Khoảng 4,6 tỷ điểm; khoảng 30 km; 11 lớp | Phân vùng ngữ nghĩa đám mây điểm đường sắt | 2024 |
Nhận dạng tư thế 6D và tư thế gắp của vật cho robot
| LINEMOD | Ảnh RGB-D của các vật thể trong cảnh có nhiều vật cản, kèm mô hình 3D và tư thế thực của từng vật thể. Bộ dữ liệu được dùng rộng rãi để đánh giá khả năng xác định vị trí và hướng của vật thể trong không gian. | 13 vật thể; 13 chuỗi | Nhận dạng tư thế 6D của vật thể | 2012 | |
| T-LESS | Ảnh RGB-D của các vật thể công nghiệp hầu như không có hoa văn bề mặt, nhiều vật thể có hình dạng tương tự hoặc đối xứng. Bộ dữ liệu còn cung cấp mô hình CAD và mô hình 3D tái tạo cho từng vật thể. | 30 vật thể; khoảng 39.000 ảnh huấn luyện và 10.000 ảnh kiểm tra cho mỗi cảm biến | Phát hiện vật thể; nhận dạng tư thế 6D của vật thể | 2017 | |
| YCB-Video | Các chuỗi video RGB-D chứa những vật thể gia dụng thuộc bộ YCB trong các cảnh có nhiều vật thể và che khuất. Mỗi frame được chú thích tư thế 6D của các vật thể xuất hiện trong ảnh. | 92 video; 133.827 frame; 21 vật thể | Nhận dạng và theo dõi tư thế 6D của vật thể | 2018 | |
| HOPE | Ảnh RGB-D của các vật thể mô phỏng sản phẩm tạp hóa trong môi trường gia đình và văn phòng, kèm mô hình 3D có kết cấu và tư thế 6D. Các cảnh được thiết kế với nhiều mức che khuất, ánh sáng và số lượng vật thể khác nhau. | 28 vật thể; 50 cảnh trong 10 môi trường | Nhận dạng tư thế 6D của vật thể | 2022 | |
| GraspNet-1Billion | Các cảnh RGB-D chứa nhiều vật thể gia dụng, kèm mô hình lưới 3D và hơn một tỷ tư thế gắp khả thi trong không gian 3D. Bộ dữ liệu được thiết kế để đánh giá trực tiếp việc chọn vị trí gắp và hướng tiếp cận vật thể của bàn tay robot trong khung cảnh lộn xộn. | 97.280 ảnh RGB-D; 88 vật thể; hơn 1 tỷ tư thế gắp | Phát hiện tư thế gắp 6D | 2020 |
Cảnh vật
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| S3DIS | Đám mây điểm màu của các không gian trong nhà tại sáu khu vực thuộc ba tòa nhà, gồm văn phòng, hành lang, phòng hội nghị và nhiều loại phòng khác. Mỗi điểm trong không gian được gán một nhãn ngữ nghĩa như tường, sàn, bàn, ghế hoặc cửa. | 6 khu vực; 272 phòng | Phân vùng ngữ nghĩa đám mây điểm trong nhà | 2016 | |
| ScanNet | Các chuỗi RGB-D quay trong nhiều không gian trong nhà, được tái dựng thành mô hình bề mặt 3D. Dữ liệu kèm tư thế và vị trí của camera, thông tin hình học 3D và nhãn ngữ nghĩa cho các vật thể trong cảnh. | 1.513 cảnh; khoảng 2,5 triệu frame RGB-D | Tái dựng cảnh 3D; phân vùng ngữ nghĩa và phân vùng thực thể | 2017 | |
| Matterport3D | Các không gian trong nhà quy mô toàn tòa nhà được ghi bằng camera RGB-D toàn cảnh. Bộ dữ liệu cung cấp ảnh RGB-D, mô hình bề mặt 3D, tư thế camera và nhãn ngữ nghĩa cho cả biểu diễn 2D lẫn 3D. | 90 tòa nhà; 10.800 góc nhìn toàn cảnh; 194.400 ảnh RGB-D | Tái dựng và hiểu cảnh 3D; phân vùng ngữ nghĩa | 2017 | |
| Semantic3D | Các đám mây điểm dày đặc được thu bằng máy quét laser mặt đất tại nhiều cảnh ngoài trời như đường phố, quảng trường, làng, đường sắt, sân thể thao và khu vực quanh các công trình. Mỗi điểm trong khung cảnh cũng được gán một trong tám lớp ngữ nghĩa. | Hơn 4 tỷ điểm; 8 lớp | Phân vùng ngữ nghĩa đám mây điểm ngoài trời | 2017 |
Dữ liệu văn bản
Phân tích cảm xúc từ các bài đánh giá
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Large Movie Review Dataset (IMDb) | Các bài đánh giá phim trên IMDb, được gán nhãn tích cực hoặc tiêu cực dựa trên điểm đánh giá. Dữ liệu còn gồm các bài đánh giá chưa gán nhãn. | 50.000 bài đánh giá có nhãn; 50.000 bài chưa gán nhãn | Phân tích cảm xúc | 2011 | |
| Stanford Sentiment Treebank | Các câu trích từ bài đánh giá phim, trong đó cả câu hoàn chỉnh và các cụm từ cấu thành câu đều được gán nhãn cảm xúc. Nhãn cho phép phân biệt nhiều mức cảm xúc của người dùng từ rất tiêu cực đến rất tích cực. | 11.855 câu; 215.154 cụm từ được gán nhãn | Phân tích cảm xúc; phân tích cảm xúc theo thành phần câu | 2013 | |
| Sentiment Labeled Sentences | Các câu ngắn từ bài đánh giá trên IMDb, Amazon và Yelp, được gán nhãn tích cực hoặc tiêu cực bằng tay. | 3.000 câu; 1.000 câu từ mỗi nguồn | Phân tích cảm xúc | 2015 | |
| Yelp Review Polarity | Các bài đánh giá doanh nghiệp trên Yelp, trong đó đánh giá 1–2 sao được gán nhãn tiêu cực và 4–5 sao được gán nhãn tích cực. | 560.000 mẫu huấn luyện; 38.000 mẫu kiểm tra; 2 lớp | Phân tích cảm xúc | 2015 | |
| Yelp Review Full | Các bài đánh giá doanh nghiệp trên Yelp, được gán một trong năm nhãn tương ứng với mức đánh giá từ 1 đến 5 sao. | 650.000 mẫu huấn luyện; 50.000 mẫu kiểm tra; 5 lớp | Phân loại mức đánh giá; phân tích cảm xúc | 2015 | |
| Amazon Review Polarity | Các bài đánh giá sản phẩm trên Amazon, trong đó đánh giá 1–2 sao được gán nhãn tiêu cực và 4–5 sao được gán nhãn tích cực. | 3,6 triệu mẫu huấn luyện; 400.000 mẫu kiểm tra; 2 lớp | Phân tích cảm xúc | 2015 | |
| Amazon Review Full | Các bài đánh giá sản phẩm trên Amazon, được gán một trong năm nhãn tương ứng với mức đánh giá từ 1 đến 5 sao. | 3 triệu mẫu huấn luyện; 650.000 mẫu kiểm tra; 5 lớp | Phân loại mức đánh giá; phân tích cảm xúc | 2015 |
Tin tức
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Reuters-21578 | Các bản tin tiếng Anh của Reuters được gán nhãn một hoặc nhiều chủ đề như kinh tế, hàng hóa và doanh nghiệp. Bộ dữ liệu có nhiều cách chia tập; trong đó chia theo mốc thời gian xuất bản bài báo ModApte thường được sử dụng trong nghiên cứu phân loại văn bản. | 21.578 văn bản | Phân loại chủ đề; phân loại đa nhãn | 1997 | |
| Reuters Corpus Volume I (RCV1) | Kho bản tin Reuters bằng tiếng Anh trong khoảng một năm, được các biên tập viên Reuters gán thủ công nhiều loại nhãn về chủ đề, ngành kinh tế và khu vực địa lý. | 806.791 bản tin | Phân loại chủ đề; phân loại đa nhãn | 2004 | |
| AG News | Tiêu đề và phần mô tả ngắn của các bài báo được thu thập từ hơn 2.000 nguồn tin. Phiên bản benchmark sử dụng bốn chủ đề lớn: tin tức thế giới, thể thao, kinh doanh và khoa học–công nghệ. | 120.000 mẫu huấn luyện; 7.600 mẫu kiểm tra; 4 lớp | Phân loại chủ đề | 2015 | |
| Sogou News | Các bài báo tiếng Trung từ các kho tin tức SogouCA và SogouCS. Phiên bản benchmark sử dụng tiêu đề và nội dung bài báo thuộc năm chủ đề. | 450.000 mẫu huấn luyện; 60.000 mẫu kiểm tra; 5 lớp | Phân loại chủ đề | 2015 | |
| CNN/Daily Mail | Các bài báo từ CNN và Daily Mail cùng phần điểm tin chính do tòa soạn cung cấp. Các điểm tin được sử dụng làm bản tóm tắt tham chiếu cho bài báo. | Khoảng 312.000 cặp bài báo–tóm tắt | Tóm tắt văn bản | 2015 | |
| XSum | Các bài báo trực tuyến của BBC đi kèm một câu tóm tắt ngắn do người viết bài cung cấp. Bộ dữ liệu được thiết kế để tóm tắt toàn bộ nội dung bài báo thành một câu súc tích thay vì chỉ trích lại các câu có sẵn trong bài. | 226.711 bài báo | Tóm tắt văn bản | 2018 | |
| Multi-News | Các cụm bài báo từ nhiều nguồn cùng đề cập đến một sự kiện hoặc chủ đề, đi kèm một bản tóm tắt chung do con người viết. | 56.216 cặp cụm tài liệu–tóm tắt | Tóm tắt nhiều văn bản | 2019 |
Thư điện tử và tin nhắn
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Enron Corpus | Kho thư điện tử của các nhân viên từ công ty Enron được công khai trong quá trình điều tra pháp lý đối với công ty. Dữ liệu gồm nội dung thư, người gửi, người nhận và cấu trúc thư mục thư điện tử. Bộ dữ liệu này đã được sử dụng cho nhiều bài toán như phân loại, truy hồi thông tin và phân tích giao tiếp. | 619.446 thư điện tử trong kho dữ liệu gốc; 158 người dùng | Phân loại và truy hồi thư điện tử; phân tích giao tiếp | 2004 | |
| Ling-Spam | Thư hợp lệ từ một danh sách thư điện tử về ngôn ngữ học được kết hợp với thư rác nhận được bởi những người tạo bộ dữ liệu. Bộ dữ liệu được cung cấp dưới nhiều phiên bản khác nhau tùy theo việc có áp dụng danh sách từ dừng và chuẩn hóa thành từ gốc (như bỏ phụ tố -ing, -ed, -zation, etc.) hay không. | 2.893 thư; 2.412 thư hợp lệ và 481 thư rác | Phát hiện thư rác | 2000 | |
| SMS Spam Collection | Các tin nhắn SMS thực được tổng hợp từ nhiều nguồn và gán nhãn thành tin nhắn hợp lệ hoặc thư rác. Nội dung được giữ ở dạng văn bản thô thay vì chỉ cung cấp các đặc trưng đã trích xuất. | 5.574 tin nhắn; 4.827 hợp lệ và 747 thư rác | Phát hiện tin nhắn rác | 2011 | |
| NUS SMS Corpus | Kho tin nhắn SMS được thu thập từ người dùng điện thoại di động, chủ yếu tại Singapore. Không giống SMS Spam Collection, dữ liệu không được xây dựng riêng cho bài toán phát hiện tin nhắn rác mà phản ánh giao tiếp SMS thông thường. | 67.093 tin nhắn trong phiên bản năm 2015 | Mô hình hóa ngôn ngữ; phân tích ngôn ngữ trong tin nhắn | 2013 |
Mạng xã hội và diễn đàn trực tuyến
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Twenty Newsgroups | Các bài đăng trên 20 nhóm thảo luận Usenet về những chủ đề như máy tính, khoa học, thể thao, chính trị và tôn giáo. Các nhóm có số lượng bài tương đối cân bằng và thường được dùng làm benchmark phân loại văn bản. | Khoảng 20.000 bài đăng; 20 nhóm | Phân loại chủ đề | 1995 | |
| Sentiment140 | Các bài đăng Twitter bằng tiếng Anh được gán nhãn cảm xúc tự động dựa trên biểu tượng cảm xúc có trong bài đăng. Biểu tượng dùng để tạo nhãn sau đó được loại khỏi nội dung để mô hình không thể dự đoán trực tiếp từ chúng. | Khoảng 1,6 triệu bài đăng | Phân tích cảm xúc | 2009 | |
| OLID | Các bài đăng Twitter tiếng Anh được chú thích theo ba tầng: có hay không có ngôn ngữ xúc phạm; nếu có, loại nội dung xúc phạm và đối tượng mà nội dung đó hướng tới. | 14.200 bài đăng | Phát hiện và phân loại ngôn ngữ xúc phạm; xác định đối tượng bị nhắm tới | 2019 | |
| UIT-VSMEC | Các bình luận tiếng Việt trên mạng xã hội được gán một trong bảy nhãn cảm xúc gồm vui vẻ, buồn bã, tức giận, ngạc nhiên, sợ hãi, ghê tởm và khác. | 6.927 bình luận; 7 lớp cảm xúc | Nhận dạng cảm xúc | 2020 | |
| TweetEval | Bộ benchmark tổng hợp các tập dữ liệu Twitter đã có trước đó và chuẩn hóa chúng thành bảy tác vụ phân loại với cùng cách đánh giá, gồm phân tích cảm xúc, nhận dạng cảm xúc, phát hiện ngôn ngữ thù ghét, ngôn ngữ xúc phạm, mỉa mai, dự đoán emoji và xác định lập trường của người đăng. | 7 tác vụ | Phân tích cảm xúc; nhận dạng cảm xúc; phát hiện ngôn ngữ thù ghét và xúc phạm; phát hiện mỉa mai; xác định lập trường | 2020 | |
| Pushshift Reddit | Kho lưu trữ quy mô lớn các bài đăng và bình luận công khai trên Reddit, bao phủ dữ liệu lịch sử từ khi nền tảng được thành lập. Dữ liệu giữ cả nội dung văn bản cùng thông tin về subreddit, người dùng, thời gian và cấu trúc thảo luận. | Hàng tỷ bài đăng và bình luận | Phân tích mạng xã hội; xử lý ngôn ngữ tự nhiên; nghiên cứu cộng đồng trực tuyến | 2020 | |
| HateXplain | Các bài đăng từ Twitter và Reddit được chú thích theo ba lớp bao gồm ngôn ngữ thù ghét, nội dung xúc phạm và bình thường. Mỗi mẫu còn có nhãn về nhóm bị nhắm tới và những từ hoặc cụm từ mà người chú thích sử dụng để giải thích quyết định của mình. | Hơn 20.000 bài đăng | Phát hiện ngôn ngữ thù ghét và xúc phạm; giải thích dự đoán | 2021 |
Hỏi đáp và đọc hiểu
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| TREC Question Classification | Các câu hỏi tiếng Anh được gán nhãn theo loại câu trả lời cần tìm, chẳng hạn người, địa điểm, số lượng hoặc thực thể. Bộ dữ liệu thường được dùng để đánh giá khả năng phân loại câu hỏi trước bước tìm câu trả lời. | 5.500 câu huấn luyện; 500 câu kiểm tra; 6 lớp lớn và 50 lớp con | Phân loại câu hỏi theo cả nhãn lớn và nhãn con | 2002 | |
| SQuAD | Các đoạn văn lấy từ Wikipedia kèm các câu hỏi do người tham gia đặt dựa trên nội dung đoạn văn. Trong phiên bản đầu, câu trả lời cho mỗi câu hỏi là một đoạn văn bản tiếp theo sau đoạn văn đó. | 107.785 cặp câu hỏi–câu trả lời từ 536 bài viết Wikipedia | Đọc hiểu; trích xuất câu trả lời | 2016 | |
| RACE | Các đoạn văn và câu hỏi trắc nghiệm lấy từ các kỳ thi tiếng Anh dành cho học sinh trung học cơ sở và trung học phổ thông tại Trung Quốc. Nhiều câu hỏi yêu cầu suy luận từ nội dung thay vì chỉ tìm một cụm từ xuất hiện trực tiếp trong đoạn văn. | 27.933 đoạn văn; 97.687 câu hỏi | Đọc hiểu trắc nghiệm | 2017 | |
| HotpotQA | Các câu hỏi dựa trên Wikipedia được thiết kế để cần kết hợp thông tin từ nhiều tài liệu hoặc nhiều câu khác nhau. Ngoài câu trả lời, bộ dữ liệu còn cung cấp các câu làm bằng chứng để hỗ trợ cho quá trình suy luận của mô hình. | Khoảng 113.000 cặp câu hỏi–câu trả lời | Hỏi đáp nhiều bước; đọc hiểu; xác định bằng chứng | 2018 | |
| Natural Questions | Các truy vấn tìm kiếm thực của người dùng Google đã được ẩn danh hóa, mỗi câu hỏi đi kèm một trang Wikipedia từ các kết quả tìm kiếm hàng đầu. Mỗi trang được gán nhãn để xác định câu trả lời dài, câu trả lời ngắn hoặc cho biết trang không chứa câu trả lời. | 307.373 mẫu huấn luyện; 7.830 mẫu phát triển | Hỏi đáp; đọc hiểu; xác định câu trả lời ngắn và dài | 2019 |
Suy luận ngôn ngữ
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| SNLI | Các cặp câu tiếng Anh gồm một câu tiền đề và một câu giả thuyết, được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Các câu tiền đề bắt nguồn từ chú thích ảnh. | Khoảng 570.000 cặp câu | Suy luận ngôn ngữ tự nhiên | 2015 | |
| MultiNLI | Các cặp câu tiếng Anh gồm một câu tiền đề và một câu giả thuyết, được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Văn bản được lấy từ nhiều thể loại nói và viết như hội thoại, thư từ, báo chí, tiểu thuyết và văn bản chính phủ. | Khoảng 433.000 cặp câu; 10 thể loại | Suy luận ngôn ngữ tự nhiên; đánh giá khả năng khái quát giữa các thể loại văn bản | 2018 | |
| XNLI | Các cặp câu tiền đề–giả thuyết từ MultiNLI được dịch sang 15 ngôn ngữ và giữ cùng ba nhãn: suy ra, mâu thuẫn hoặc trung lập. | 7.500 cặp câu được gán nhãn bằng 15 ngôn ngữ trong tập đánh giá | Suy luận ngôn ngữ tự nhiên đa ngôn ngữ; chuyển giao giữa các ngôn ngữ | 2018 | |
| ANLI | Các cặp câu tiền đề–giả thuyết được gán một trong ba nhãn: suy ra, mâu thuẫn hoặc trung lập. Dữ liệu được xây dựng qua nhiều vòng đối kháng, trong đó người tham gia tạo các ví dụ khiến mô hình hiện tại phân loại sai. | Hơn 160.000 cặp câu qua 3 vòng | Suy luận ngôn ngữ tự nhiên; đánh giá độ bền của mô hình | 2020 |
Hội thoại
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| DailyDialog | Các đoạn hội thoại qua lại giữa hai người bằng tiếng Anh về những tình huống thường ngày như công việc, trường học, mua sắm và các mối quan hệ. Mỗi lượt lời được gán nhãn về mục đích giao tiếp và cảm xúc. | 13.118 đoạn hội thoại | Sinh phản hồi hội thoại; nhận dạng mục đích giao tiếp và cảm xúc | 2017 | |
| Persona-Chat | Các đoạn hội thoại giữa hai người, trong đó mỗi người được cung cấp một hồ sơ gồm một số câu mô tả đặc điểm và sở thích của nhân vật mà họ đóng vai. Nội dung hội thoại được xây dựng sao cho phù hợp với những thông tin trong hồ sơ này. | 10.907 đoạn hội thoại | Sinh hội thoại; duy trì tính nhất quán của nhân vật | 2018 | |
| MultiWOZ | Các đoạn hội thoại viết giữa người dùng và người đóng vai trợ lý, trong đó người dùng cần hoàn thành các tác vụ thuộc nhiều lĩnh vực như đặt khách sạn, tìm nhà hàng, đi tàu và đặt taxi. Một đoạn hội thoại có thể liên quan đến nhiều lĩnh vực khác nhau và đi kèm nhãn trạng thái hội thoại. | 10.438 đoạn hội thoại; 7 lĩnh vực | Hội thoại hướng tác vụ; theo dõi trạng thái hội thoại; sinh phản hồi | 2018 | |
| Taskmaster-1 | Các đoạn hội thoại hướng tác vụ trong sáu lĩnh vực như đặt vé xem phim, nhà hàng, cà phê, đặt xe và sửa chữa ô tô. Bộ dữ liệu gồm cả hội thoại giữa hai người và hội thoại do một người tự viết theo cả hai vai để tạo ra các luồng hội thoại đa dạng hơn. | 13.215 đoạn hội thoại; 6 lĩnh vực | Hội thoại hướng tác vụ; sinh phản hồi; hiểu yêu cầu người dùng | 2019 |
Hội thoại và tinh chỉnh theo chỉ dẫn
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Flan Collection | Tập hợp các bộ dữ liệu và mẫu hướng dẫn cho nhiều tác vụ xử lý ngôn ngữ tự nhiên, được chuyển về dạng đầu vào–đầu ra theo chỉ dẫn với các thiết lập không ví dụ, có ví dụ và chuỗi suy luận. | 1.836 tác vụ trong Flan 2022 | Tinh chỉnh theo chỉ dẫn; học đa tác vụ | 2023 | |
| OpenAssistant Conversations (OASST1) | Các cây hội thoại nhiều lượt giữa người dùng và trợ lý do con người viết bằng nhiều ngôn ngữ, kèm các đánh giá chất lượng cho từng tin nhắn và phản hồi. | 161.443 tin nhắn; 35 ngôn ngữ; hơn 10.000 cây hội thoại hoàn chỉnh | Tinh chỉnh theo chỉ dẫn; tinh chỉnh có giám sát; căn chỉnh mô hình ngôn ngữ | 2023 | |
| UltraChat | Các đoạn hội thoại nhiều lượt giữa người dùng mô phỏng và trợ lý, được tạo tự động bằng các mô hình ngôn ngữ theo nhiều chủ đề và loại yêu cầu khác nhau mà không sử dụng truy vấn trực tiếp từ người dùng thật. | 1,5 triệu đoạn hội thoại nhiều lượt | Tinh chỉnh theo chỉ dẫn; sinh hội thoại; tinh chỉnh chatbot | 2023 | |
| LMSYS-Chat-1M | Các đoạn hội thoại thực tế giữa người dùng và 25 mô hình ngôn ngữ lớn được thu thập từ Vicuna demo và Chatbot Arena, kèm thông tin về mô hình, ngôn ngữ và nhãn kiểm duyệt nội dung. | 1 triệu đoạn hội thoại; 25 mô hình ngôn ngữ lớn | Phân tích tương tác người–mô hình; tinh chỉnh theo chỉ dẫn; nghiên cứu an toàn mô hình | 2024 | |
| WildChat | Các đoạn hội thoại thực tế giữa người dùng và ChatGPT được thu thập từ một dịch vụ chatbot công khai, bao phủ nhiều ngôn ngữ, chủ đề và dạng yêu cầu trong sử dụng thực tế. | Khoảng 1 triệu đoạn hội thoại; hơn 2,5 triệu lượt tương tác | Phân tích tương tác người–mô hình; tinh chỉnh và đánh giá chatbot; nghiên cứu an toàn mô hình | 2024 |
Kiến thức, suy luận và đánh giá mô hình ngôn ngữ
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| MMLU | Các câu hỏi trắc nghiệm thuộc 57 môn và lĩnh vực kiến thức, bao gồm toán học, khoa học, lịch sử, khoa học máy tính, luật và nhiều lĩnh vực khác. | 57 tác vụ; khoảng 16.000 câu hỏi | Đánh giá kiến thức đa lĩnh vực; giải câu hỏi trắc nghiệm | 2021 | |
| GSM8K | Các bài toán có lời văn ở trình độ tiểu học, mỗi bài đi kèm lời giải bằng ngôn ngữ tự nhiên gồm nhiều bước suy luận và phép tính cơ bản. | 8.500 bài toán | Suy luận toán học; giải bài toán có lời văn | 2021 | |
| AI2 Reasoning Challenge (ARC) | Các câu hỏi khoa học trắc nghiệm lấy từ các kỳ thi ở bậc phổ thông, được chia thành tập Easy và Challenge; tập Challenge gồm các câu mà những phương pháp truy hồi và đồng xuất hiện từ đơn giản đều trả lời sai. | 7.787 câu hỏi | Hỏi đáp khoa học; đánh giá kiến thức và suy luận | 2018 | |
| HellaSwag | Các tình huống bằng ngôn ngữ tự nhiên kèm nhiều phương án tiếp diễn, trong đó mô hình phải chọn phương án hợp lý nhất. Các phương án sai được tạo và lọc theo quy trình đối kháng để khó phân biệt bằng các đặc trưng bề mặt. | Khoảng 70.000 mẫu | Suy luận thường thức; chọn phần tiếp diễn hợp lý | 2019 | |
| TruthfulQA | Các câu hỏi thuộc 38 chủ đề được thiết kế xoay quanh những quan niệm sai hoặc niềm tin phổ biến có thể khiến người hoặc mô hình đưa ra câu trả lời không đúng sự thật. | 817 câu hỏi; 38 chủ đề | Đánh giá tính đúng sự thật của câu trả lời; hỏi đáp | 2022 |
Dịch máy
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Hansard French-English | Các câu song song tiếng Pháp–Anh được trích từ biên bản tranh luận của Quốc hội Canada. | 2.869.040 cặp câu trong phần IBM | Dịch máy Pháp–Anh | 1995 | |
| Europarl | Các văn bản song song được trích từ biên bản của Nghị viện châu Âu, gồm các bản dịch chính thức giữa nhiều ngôn ngữ châu Âu. | Khoảng 30 triệu từ cho mỗi ngôn ngữ trong phiên bản ban đầu; 11 ngôn ngữ | Dịch máy song ngữ và đa ngữ | 2005 | |
| IWSLT | Các văn bản song song được xây dựng chủ yếu từ bản ghi và bản dịch của các bài nói TED, với các cặp ngôn ngữ thay đổi theo từng chiến dịch đánh giá. | Thay đổi theo năm và cặp ngôn ngữ | Dịch máy; dịch lời nói | 2004– | |
| OPUS | Các văn bản song song được thu thập từ nhiều nguồn đã được dịch trên Internet, gồm phụ đề, tài liệu phần mềm và văn bản hành chính, rồi được căn chỉnh giữa nhiều ngôn ngữ. | Nhiều tập dữ liệu song song và hàng trăm ngôn ngữ; quy mô thay đổi theo phiên bản | Dịch máy song ngữ và đa ngữ | 2004 | |
| WMT 2014 | Dữ liệu song song và đơn ngữ dùng cho nhiệm vụ dịch máy của Workshop on Statistical Machine Translation năm 2014, với các cặp ngôn ngữ gồm tiếng Anh với tiếng Séc, Đức, Pháp, Hindi và Nga. | Quy mô thay đổi theo cặp ngôn ngữ; các thiết lập Anh–Đức và Anh–Pháp có hàng triệu cặp câu huấn luyện | Dịch máy; đánh giá hệ thống dịch máy | 2014 | |
| OpenSubtitles2016 | Các câu song song được trích và căn chỉnh từ phụ đề phim và chương trình truyền hình, nên chứa nhiều ngôn ngữ hội thoại và cách diễn đạt đời thường. | Khoảng 2,6 tỷ câu; 1.689 cặp văn bản song song; 60 ngôn ngữ | Dịch máy song ngữ và đa ngữ | 2016 | |
| United Nations Parallel Corpus | Các tài liệu chính thức của Liên Hợp Quốc được căn chỉnh giữa sáu ngôn ngữ chính thức của tổ chức: Ả Rập, Trung Quốc, Anh, Pháp, Nga và Tây Ban Nha. | Khoảng 800.000 tài liệu; 6 ngôn ngữ | Dịch máy đa ngữ; căn chỉnh văn bản song song | 2016 | |
| ParaCrawl | Các câu song song được khai thác tự động từ các trang web đa ngôn ngữ, bao phủ nhiều lĩnh vực và cặp ngôn ngữ. | Quy mô hàng tỷ cặp câu; thay đổi theo phiên bản và cặp ngôn ngữ | Huấn luyện dịch máy; khai thác và lọc câu song song | 2020 | |
| OPUS-100 | Các cặp câu song song lấy từ OPUS, được tổ chức thành tập dữ liệu đa ngôn ngữ lấy tiếng Anh làm trung tâm và giới hạn lượng dữ liệu tối đa cho mỗi cặp ngôn ngữ. | Khoảng 55 triệu cặp câu; 100 ngôn ngữ | Dịch máy đa ngữ; dịch giữa các cặp ngôn ngữ chưa xuất hiện trực tiếp trong dữ liệu huấn luyện | 2020 | |
| FLORES-101 | Các đoạn văn tham chiếu được dịch thủ công sang 101 ngôn ngữ, với cùng nội dung được căn chỉnh giữa các ngôn ngữ. | 3.001 câu cho mỗi ngôn ngữ; 101 ngôn ngữ | Đánh giá dịch máy đa ngữ và ngôn ngữ ít tài nguyên | 2021 | |
| FLORES-200 | Các đoạn văn tham chiếu được dịch giữa hơn 200 ngôn ngữ, mở rộng FLORES-101 để hỗ trợ đánh giá nhất quán trên nhiều chiều dịch hơn. | Hơn 200 ngôn ngữ; hơn 40.000 chiều dịch có thể đánh giá | Đánh giá dịch máy đa ngữ và ngôn ngữ ít tài nguyên | 2022 | |
| WikiMatrix | Các cặp câu song song được khai thác tự động từ các bài viết Wikipedia bằng biểu diễn câu đa ngôn ngữ, không giới hạn việc ghép các ngôn ngữ với tiếng Anh. | 135 triệu cặp câu; 1.620 cặp ngôn ngữ; 96 ngôn ngữ | Huấn luyện dịch máy; khai thác câu song song | 2021 |
Pháp lý
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| EURLEX57K | Các văn bản pháp luật của Liên minh châu Âu bằng tiếng Anh từ cơ sở dữ liệu EUR-Lex, được gán nhiều nhãn theo hệ thống chủ đề EUROVOC. | 57.000 văn bản; khoảng 4.300 nhãn | Phân loại văn bản pháp lý đa nhãn | 2019 | |
| LEDGAR | Các điều khoản được trích từ hợp đồng công khai trong hồ sơ của Ủy ban Giao dịch và Chứng khoán Hoa Kỳ, và được gán nhãn theo loại điều khoản. | 846.274 điều khoản; 12.608 loại nhãn trong tập dữ liệu đầy đủ | Phân loại điều khoản hợp đồng đa nhãn | 2020 | |
| MultiEURLEX | Các văn bản pháp luật của Liên minh châu Âu được dịch chính thức sang nhiều ngôn ngữ và gán nhiều nhãn chủ đề theo EUROVOC. Bộ dữ liệu còn được chia theo thời gian để đánh giá ảnh hưởng của sự thay đổi nội dung pháp luật theo thời gian. | 65.000 văn bản; 23 ngôn ngữ | Phân loại văn bản pháp lý đa ngôn ngữ và đa nhãn | 2021 | |
| CUAD | Các hợp đồng thương mại tiếng Anh được các chuyên gia pháp lý đánh dấu những đoạn chứa các điều khoản quan trọng đối với quá trình rà soát hợp đồng, như quyền chấm dứt, miễn trừ trách nhiệm và điều khoản không cạnh tranh. | 510 hợp đồng; hơn 13.000 chú thích; 41 loại điều khoản | Trích xuất và nhận dạng điều khoản hợp đồng | 2021 | |
| ContractNLI | Các hợp đồng bảo mật được ghép với những phát biểu về nội dung hợp đồng. Mỗi phát biểu được xác định là được hợp đồng xác nhận, mâu thuẫn với hợp đồng hoặc không được đề cập; dữ liệu còn chỉ ra đoạn văn làm bằng chứng. | 607 hợp đồng | Suy luận ngôn ngữ tự nhiên trên hợp đồng; xác định bằng chứng | 2021 | |
| CaseHOLD | Các câu hỏi trắc nghiệm được xây dựng từ án lệ Hoa Kỳ. Mỗi mẫu gồm ngữ cảnh trích dẫn từ một phán quyết và năm phát biểu về kết luận pháp lý của vụ án được dẫn, trong đó một lựa chọn là phù hợp. | Hơn 53.000 câu hỏi | Đọc hiểu và suy luận trên án lệ | 2021 | |
| LexGLUE | Bộ benchmark tập hợp nhiều bộ dữ liệu tiếng Anh thuộc các nguồn pháp lý khác nhau, gồm luật của Liên minh châu Âu, phán quyết của Tòa án Nhân quyền châu Âu, hợp đồng và án lệ Hoa Kỳ. Các tác vụ được chuẩn hóa để so sánh mô hình trên nhiều dạng hiểu văn bản pháp lý. | 7 bộ dữ liệu | Phân loại văn bản; dự đoán phán quyết; phân loại điều khoản; suy luận và đọc hiểu pháp lý | 2022 | |
| LegalBench | Bộ benchmark gồm nhiều tác vụ do các nhà nghiên cứu luật và máy học xây dựng hoặc chuẩn hóa để đánh giá nhiều dạng suy luận pháp lý, từ áp dụng quy tắc pháp luật đến giải thích hợp đồng và án lệ. | 162 tác vụ từ 36 nguồn dữ liệu | Đánh giá suy luận pháp lý | 2023 |
Tiền huấn luyện mô hình ngôn ngữ
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| BookCorpus | Văn bản tiếng Anh từ các sách hư cấu được xuất bản miễn phí trên Internet, gồm các đoạn văn liên tục từ nhiều thể loại. | 11.038 cuốn sách; khoảng 74 triệu câu | Mô hình hóa ngôn ngữ; tiền huấn luyện mô hình ngôn ngữ | 2015 | |
| WikiText-103 | Văn bản tiếng Anh từ các bài viết chất lượng cao trên Wikipedia, giữ lại phần lớn cấu trúc văn bản, dấu câu, chữ hoa và số. | Hơn 103 triệu từ | Mô hình hóa ngôn ngữ; dự đoán văn bản | 2017 | |
| C4 | Văn bản tiếng Anh được trích từ Common Crawl, sau đó được lọc và làm sạch để loại nội dung không phù hợp hoặc có chất lượng thấp. | Khoảng 750 GB văn bản tiếng Anh trong phiên bản ban đầu | Tiền huấn luyện mô hình ngôn ngữ; mô hình hóa ngôn ngữ | 2020 | |
| The Pile | Văn bản tiếng Anh được tổng hợp từ 22 nguồn, gồm nội dung web, sách, bài báo khoa học, mã nguồn, văn bản pháp lý và Wikipedia. | 825 GiB; 22 nguồn dữ liệu | Tiền huấn luyện và đánh giá mô hình ngôn ngữ | 2021 | |
| OSCAR | Văn bản web đa ngôn ngữ được trích từ Common Crawl, sau đó được nhận dạng ngôn ngữ và lọc theo từng ngôn ngữ. | Hơn 150 ngôn ngữ; quy mô thay đổi theo phiên bản | Tiền huấn luyện mô hình ngôn ngữ đa ngữ; mô hình hóa ngôn ngữ | 2019 | |
| RefinedWeb | Văn bản tiếng Anh được trích từ Common Crawl, sau đó được lọc và loại trùng để giữ lại dữ liệu web có chất lượng cao hơn. | Khoảng 5 nghìn tỷ token sau xử lý; 600 tỷ token được công bố | Tiền huấn luyện mô hình ngôn ngữ | 2023 | |
| Dolma | Văn bản tiếng Anh được tổng hợp từ sáu nhóm nguồn, gồm nội dung web, bài báo khoa học, mã nguồn, sách thuộc phạm vi công cộng, mạng xã hội và tài liệu bách khoa. | 3 nghìn tỷ token; hơn 4 tỷ tài liệu | Tiền huấn luyện mô hình ngôn ngữ | 2024 | |
| FineWeb | Văn bản tiếng Anh được trích từ 96 bản lưu Common Crawl, sau đó được lọc, làm sạch và loại trùng; FineWeb-Edu là tập con được lọc để ưu tiên nội dung mang tính giáo dục. | 15 nghìn tỷ token; FineWeb-Edu khoảng 1,3 nghìn tỷ token | Tiền huấn luyện mô hình ngôn ngữ | 2024 | |
| RedPajama-V2 | Văn bản web được trích từ 84 bản lưu Common Crawl bằng quy trình CCNet, kèm các tín hiệu về chất lượng và mức độ trùng lặp của từng tài liệu. | Hơn 100 tỷ tài liệu; 30 tỷ tài liệu có tín hiệu chất lượng; 20 tỷ tài liệu sau loại trùng | Tiền huấn luyện mô hình ngôn ngữ; nghiên cứu lọc và lựa chọn dữ liệu | 2024 |
Khác
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| DBpedia Ontology | Văn bản được trích từ các bài viết Wikipedia thông qua DBpedia và chia thành các lớp theo hệ thống phân loại của DBpedia. | 560.000 mẫu huấn luyện; 70.000 mẫu kiểm tra; 14 lớp | Phân loại văn bản | 2015 | |
| GLUE | Bộ benchmark tập hợp nhiều bộ dữ liệu tiếng Anh để đánh giá khả năng hiểu ngôn ngữ trên các tác vụ như suy luận ngôn ngữ, mức độ tương đồng giữa câu và phân loại quan hệ giữa các câu. | 9 tác vụ được tính vào điểm benchmark | Đánh giá khả năng hiểu ngôn ngữ tổng quát | 2019 | |
| SuperGLUE | Bộ benchmark kế tiếp GLUE, tập hợp các tác vụ khó hơn về suy luận, đọc hiểu, phân giải đồng tham chiếu và hiểu nghĩa của từ trong ngữ cảnh. | 8 tác vụ chính | Đánh giá khả năng hiểu và suy luận ngôn ngữ tổng quát | 2019 |
Dữ liệu âm thanh
Tiếng nói
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| TIMIT | Các câu tiếng Anh được thu âm trong điều kiện kiểm soát từ người nói thuộc nhiều phương ngữ tại Hoa Kỳ. Dữ liệu kèm bản chép lời và nhãn ngữ âm được căn chỉnh với tín hiệu. | 6.300 câu; 630 người nói | Nhận dạng tiếng nói; nhận dạng âm vị | 1993 | |
| Switchboard | Các cuộc hội thoại điện thoại tự nhiên bằng tiếng Anh giữa những người tham gia được ghép cặp để thảo luận về các chủ đề được cho trước. | Khoảng 2.400 cuộc hội thoại; khoảng 260 giờ | Nhận dạng tiếng nói; mô hình hóa hội thoại nói | 1992 | |
| LibriSpeech | Các bản đọc từ sách nói tiếng Anh được trích từ LibriVox và căn chỉnh với văn bản từ Dự án Gutenberg. Dữ liệu được chia thành các tập có mức độ nhiễu và độ khó khác nhau. | Khoảng 1.000 giờ tiếng nói; 2.484 người nói | Nhận dạng tiếng nói; tiền huấn luyện mô hình tiếng nói | 2015 | |
| VoxCeleb | Các đoạn tiếng nói của người nổi tiếng được thu thập tự động từ video phỏng vấn và nội dung trực tuyến, với sự thay đổi lớn về tiếng ồn nền, thiết bị thu và môi trường. | Hơn 100.000 đoạn phát biểu từ 1.251 người trong VoxCeleb1; VoxCeleb2 mở rộng lên hơn 6.000 người | Nhận dạng và xác minh người nói | 2017 | |
| Common Voice | Các đoạn tiếng nói do cộng đồng đóng góp và xác minh, trong đó người tham gia đọc các câu văn cho trước. Bộ dữ liệu bao phủ nhiều ngôn ngữ và được cập nhật qua nhiều phiên bản. | Hàng nghìn giờ tiếng nói; hơn 100 ngôn ngữ tùy phiên bản | Nhận dạng tiếng nói đa ngôn ngữ | 2020 | |
| Libri-Light | Các bản sách nói tiếng Anh không gán nhãn được xây dựng từ LibriVox ở quy mô lớn hơn LibriSpeech, nhằm hỗ trợ học tự giám sát và học nửa giám sát cho tiếng nói. | Khoảng 60.000 giờ âm thanh chưa gán nhãn | Học tự giám sát; học nửa giám sát; nhận dạng tiếng nói | 2020 |
Âm nhạc
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| GTZAN Genre Collection | Các đoạn nhạc dài 30 giây thuộc mười thể loại: blues, cổ điển, country, disco, hip hop, jazz, metal, pop, reggae và rock. | 1.000 đoạn âm thanh; 10 thể loại | Phân loại thể loại âm nhạc | 2002 | |
| MagnaTagATune | Các đoạn nhạc ngắn được gắn nhiều nhãn mô tả những đặc điểm như thể loại, loại nhạc cụ, tâm trạng và đặc tính âm thanh. Chúng được thu thập thông qua một trò chơi trực tuyến. | 25.863 đoạn âm thanh; 188 thẻ | Gắn đa nhãn âm nhạc | 2009 | |
| MedleyDB | Các bản nhạc hoàn chỉnh được cung cấp cùng các track âm thanh riêng của từng nhạc cụ hoặc giọng hát. Bộ dữ liệu còn có chú thích cao độ giai điệu và khoảng thời gian xuất hiện của từng nhạc cụ. | 122 bài hát trong phiên bản đầu | Trích xuất giai điệu; nhận dạng nhạc cụ; tách nguồn âm thanh | 2014 | |
| NSynth | Các bản ghi từng nốt nhạc riêng lẻ được tạo bởi nhiều nhạc cụ. Mỗi mẫu có thông tin về nhạc cụ, cao độ, vận tốc phím đàn và các đặc điểm âm sắc. | 305.979 mẫu âm thanh; 1.006 nhạc cụ | Nhận dạng nhạc cụ; học biểu diễn và sinh âm thanh âm nhạc | 2017 | |
| Free Music Archive | Các bản nhạc được phát hành theo giấy phép Creative Commons, kèm thông tin về nghệ sĩ, album, nhãn phân loại và hệ thống phân cấp thể loại. Bộ dữ liệu cung cấp cả bản ghi âm đầy đủ và các đặc trưng âm thanh đã trích sẵn. | 106.574 bài hát; 16.341 nghệ sĩ; 161 thể loại trong hệ thống phân cấp | Phân loại thể loại; gắn nhãn và truy hồi âm nhạc | 2017 | |
| MUSDB18 | Các bản thu âm nhạc được tách thành bốn nguồn gồm giọng hát, trống, bass và phần nhạc còn lại; đồng thời cung cấp bản phối hoàn chỉnh của từng bài. | 150 bài hát | Tách nguồn âm thanh âm nhạc | 2017 |
Âm thanh môi trường
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| ESC-50 | Các đoạn âm thanh ngắn về những âm thanh thường gặp trong môi trường, gồm tiếng động vật, hiện tượng tự nhiên, âm thanh của con người, âm thanh trong nhà và tiếng ồn đô thị. | 2.000 đoạn âm thanh; 50 lớp | Phân loại âm thanh môi trường | 2015 | |
| UrbanSound8K | Các đoạn âm thanh đô thị thực tế như tiếng còi xe, tiếng khoan, còi báo động, tiếng chó sủa và tiếng nhạc đường phố, được trích từ các bản ghi trên Freesound. | 8.732 đoạn âm thanh; 10 lớp | Phân loại âm thanh đô thị | 2014 | |
| TUT Acoustic Scenes 2017 | Các bản ghi âm từ nhiều môi trường thực tế như nhà ở, văn phòng, công viên, trung tâm thành phố, cửa hàng, phương tiện công cộng và ga tàu điện. Các bản ghi dài được chia thành những đoạn 10 giây để phân loại môi trường nơi âm thanh được thu. | Khoảng 52 giờ âm thanh; 15 loại cảnh | Nhận dạng cảnh âm thanh | 2017 | |
| AudioSet | Các đoạn âm thanh dài 10 giây được lấy từ video trên YouTube và gán một hoặc nhiều nhãn mô tả những sự kiện âm thanh xuất hiện, từ tiếng nói, âm nhạc và động vật đến máy móc và âm thanh môi trường. | Hơn 2 triệu đoạn âm thanh; 527 lớp | Phát hiện và phân loại sự kiện âm thanh đa nhãn | 2017 | |
| FSD50K | Các đoạn âm thanh từ Freesound được gán thủ công một hoặc nhiều nhãn sự kiện âm thanh theo hệ thống lớp của AudioSet. Không giống AudioSet, các tệp âm thanh của FSD50K được phát hành trực tiếp theo giấy phép Creative Commons. | 51.197 đoạn âm thanh; hơn 100 giờ; 200 lớp | Phân loại và phát hiện sự kiện âm thanh đa nhãn | 2021 |
Tín hiệu và chuỗi thời gian
Y sinh
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| MIT-BIH Arrhythmia Database | Các bản ghi điện tâm đồ Holter hai kênh dài khoảng 30 phút, kèm chú thích vị trí và loại của từng nhịp tim. | 48 bản ghi từ 47 người; khoảng 110.000 nhịp tim được chú thích | Phát hiện và phân loại rối loạn nhịp tim | 1980 | |
| MIT-BIH Atrial Fibrillation Database | Các bản ghi điện tâm đồ Holter dài khoảng 10 giờ từ người có bệnh rung nhĩ kịch phát, với các khoảng rung nhĩ và nhịp tim được đánh dấu theo thời gian. | 25 bản ghi dài; khoảng 250 giờ điện tâm đồ | Phát hiện rung nhĩ | 1983 | |
| PTB-XL | Các bản ghi điện tâm đồ 12 chuyển đạo dài 10 giây từ bệnh nhân trong thực hành lâm sàng. Mỗi bản ghi có thể mang nhiều nhãn chẩn đoán và các nhãn này được tổ chức thành nhiều nhóm bệnh. | 21.837 bản ghi; 18.885 bệnh nhân | Phân loại và chẩn đoán từ ECG đa nhãn | 2020 | |
| EEG Motor Movement/Imagery Dataset | Các bản ghi điện não đồ 64 kênh từ người tham gia khi thực hiện hoặc tưởng tượng các chuyển động của tay và chân. Dữ liệu gồm nhiều lần lặp của các tác vụ vận động và tưởng tượng vận động. | Hơn 1.500 bản ghi dài 1–2 phút; 109 người | Phân loại vận động và tưởng tượng vận động; giao diện não–máy tính | 2009 | |
| BCI Competition III Dataset II | Các tín hiệu điện não đồ 64 kênh được ghi khi người tham gia sử dụng hệ thống đánh vần dựa trên điện thế P300 (phản ánh hoạt động xử lý thông tin, sự chú ý và chức năng trí tuệ của não bộ). Những kích thích mục tiêu và không phải mục tiêu được đánh dấu để huấn luyện mô hình phát hiện phản ứng P300. | 2 người; 64 kênh điện não đồ; 85 lượt huấn luyện và 100 lượt kiểm tra cho mỗi người | Phát hiện P300; giao diện não–máy tính | 2006 |
Hoạt động con người
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| UCI Human Activity Recognition Using Smartphones | Tín hiệu gia tốc và vận tốc góc ba trục X Y Z được ghi bằng cảm biến của điện thoại thông minh đeo ở thắt lưng khi người tham gia thực hiện sáu hoạt động gồm đi bộ, đi lên cầu thang, đi xuống cầu thang, ngồi, đứng và nằm. | 30 người; 6 hoạt động; tín hiệu được lấy mẫu ở 50 Hz | Nhận dạng hoạt động con người | 2013 | |
| PAMAP2 | Tín hiệu từ ba bộ đo quán tính đeo ở tay, ngực và mắt cá chân cùng dữ liệu nhịp tim. Được ghi khi người tham gia thực hiện nhiều hoạt động thể chất như đi bộ, chạy, đạp xe và chơi bóng đá. | 9 người; 18 hoạt động; khoảng 3,85 triệu mẫu | Nhận dạng hoạt động; ước lượng cường độ hoạt động | 2012 | |
| OPPORTUNITY | Tín hiệu đồng bộ từ các cảm biến đeo trên cơ thể, cảm biến gắn trên đồ vật và cảm biến trong môi trường khi người tham gia thực hiện các hoạt động sinh hoạt thường ngày. Dữ liệu cho phép nhận dạng cả chuyển động của cơ thể và các thao tác với đồ vật. | 4 người trong benchmark; 23 cảm biến đeo người, 12 cảm biến trên đồ vật và 21 cảm biến môi trường | Nhận dạng hoạt động; nhận dạng thao tác; phân đoạn chuỗi tín hiệu | 2013 | |
| Daily and Sports Activities | Tín hiệu từ năm bộ cảm biến quán tính và từ trường gắn ở thân, hai tay và hai chân khi người tham gia thực hiện các hoạt động sinh hoạt và thể thao. | 8 người; 19 hoạt động; 9.120 đoạn tín hiệu | Nhận dạng hoạt động con người | 2010 | |
| REALDISP | Tín hiệu từ nhiều cảm biến quán tính đeo trên cơ thể khi người tham gia thực hiện các hoạt động thể chất. Dữ liệu được thu trong ba điều kiện bố trí cảm biến khác nhau để đánh giá ảnh hưởng của việc cảm biến bị đặt lệch vị trí. | 17 người; 33 hoạt động; khoảng 9 giờ dữ liệu | Nhận dạng hoạt động; đánh giá độ bền trước thay đổi vị trí cảm biến | 2014 | |
| Heterogeneity Activity Recognition | Tín hiệu gia tốc kế và con quay hồi chuyển được thu đồng thời từ nhiều mẫu điện thoại thông minh và đồng hồ thông minh khác nhau, nhằm phản ánh sự khác biệt giữa thiết bị và vị trí đeo trong điều kiện sử dụng thực tế. | Hơn 43 triệu mẫu; nhiều điện thoại và đồng hồ thông minh | Nhận dạng hoạt động; đánh giá khả năng khái quát giữa các thiết bị | 2015 |
Công nghiệp
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Tennessee Eastman Process | Dữ liệu mô phỏng một quy trình sản xuất hóa chất công nghiệp gồm lò phản ứng, thiết bị ngưng tụ, máy nén và các dòng tuần hoàn. Các biến đo lường và biến điều khiển được ghi theo thời gian trong điều kiện vận hành bình thường và khi xuất hiện nhiều loại lỗi quy trình. | 52 biến quy trình trong mô hình chuẩn; nhiều chế độ vận hành và tình huống lỗi tùy phiên bản | Phát hiện và chẩn đoán lỗi; giám sát quy trình | 1993 | |
| NASA C-MAPSS Turbofan Engine Degradation | Các chuỗi dữ liệu mô phỏng quá trình suy giảm của động cơ tuabin phản lực từ trạng thái hoạt động bình thường đến khi hỏng. Mỗi chu kỳ gồm điều kiện vận hành và nhiều phép đo cảm biến của động cơ. | 4 tập con; từ 100 đến 260 động cơ huấn luyện và 100 đến 259 động cơ kiểm tra tùy tập con | Ước lượng tuổi thọ hữu ích còn lại; dự đoán hỏng hóc | 2008 | |
| Paderborn University Bearing Dataset | Tín hiệu rung và dòng điện động cơ được đo đồng thời trên một hệ truyền động thử nghiệm với vòng bi khỏe mạnh và vòng bi bị hỏng. Các hư hỏng bao gồm cả lỗi nhân tạo và hư hỏng thực phát sinh trong quá trình thử nghiệm. | 32 trạng thái vòng bi; nhiều điều kiện tốc độ, tải và lực hướng kính | Phát hiện và phân loại hư hỏng vòng bi; giám sát tình trạng máy | 2016 | |
| Condition Monitoring of Hydraulic Systems | Các chuỗi tín hiệu từ một hệ thống thủy lực thử nghiệm, gồm áp suất, lưu lượng, nhiệt độ, độ rung và nhiều phép đo khác trong các chu kỳ tải 60 giây. Tình trạng của bộ làm mát, van, bơm và bình tích áp được thay đổi có kiểm soát. | 2.205 chu kỳ; 17 cảm biến | Giám sát tình trạng; phát hiện và phân loại lỗi hệ thống thủy lực | 2018 | |
| MetroPT | Chuỗi dữ liệu cảm biến liên tục từ bộ tạo khí nén trên một đoàn tàu điện đang vận hành tại Porto, gồm áp suất, nhiệt độ, dòng điện và các tín hiệu điều khiển. Các sự cố thực tế được xác định từ hồ sơ bảo trì của đơn vị vận hành. | Khoảng 1,5 triệu bản ghi trong MetroPT-3 | Phát hiện bất thường; dự đoán hỏng hóc; bảo trì dự đoán | 2022 |
Môi trường và khoa học Trái Đất
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| CAMELS-US | Chuỗi thời gian thủy văn và khí tượng của các lưu vực sông tại Hoa Kỳ, gồm lưu lượng dòng chảy, lượng mưa, nhiệt độ, độ ẩm, bức xạ, tốc độ bay hơi nước và các biến khí tượng khác, kèm các thuộc tính tương đối ổn định của từng lưu vực như địa hình, đất, địa chất và thảm thực vật. | 671 lưu vực | Dự báo lưu lượng; mô hình hóa thủy văn | 2017 | |
| CAMELS-CL | Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Chile, trải dài qua nhiều điều kiện khí hậu từ sa mạc Atacama đến các vùng ôn đới và Patagonia. | 516 lưu vực | Dự báo lưu lượng; mô hình hóa thủy văn; nghiên cứu ảnh hưởng của khí hậu | 2018 | |
| CAMELS-BR | Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Brazil. | 897 lưu vực trong tập dữ liệu chuẩn hóa | Dự báo lưu lượng; mô hình hóa thủy văn | 2020 | |
| CAMELS-GB | Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Anh, Scotland và Xứ Wales. | 671 lưu vực | Dự báo lưu lượng; mô hình hóa thủy văn | 2020 | |
| CAMELS-AUS | Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Australia. | 222 lưu vực trong phiên bản đầu | Dự báo lưu lượng; mô hình hóa thủy văn | 2021 | |
| LamaH-CE | Chuỗi thời gian khí tượng và thủy văn cùng các thuộc tính lưu vực tại Trung Âu. Dữ liệu còn biểu diễn mối liên hệ giữa các lưu vực trong mạng lưới sông. | 859 lưu vực có trạm đo | Dự báo lưu lượng; mô hình hóa thủy văn; mô hình hóa mạng lưới sông | 2021 | |
| ERA5-Land | Dữ liệu tái phân tích toàn cầu mô tả diễn biến theo thời gian của các biến trên bề mặt đất như nhiệt độ, lượng mưa, độ ẩm đất, tuyết, bức xạ và các thành phần của chu trình nước và năng lượng. | Dữ liệu toàn cầu theo giờ, độ phân giải khoảng 9 km | Dự báo và mô hình hóa khí tượng; nghiên cứu khí hậu và thủy văn | 2021 |
Giao thông
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| METR-LA | Chuỗi các giá trị đo tốc độ của các phương tiện tham gia giao thông được ghi từ các cảm biến trên mạng lưới đường cao tốc tại Los Angeles. Các phép đo được lấy theo khoảng thời gian đều đặn và có thể kết hợp với cấu trúc mạng lưới đường xá. | 207 cảm biến; dữ liệu từ tháng 3 đến tháng 6 năm 2012; khoảng lấy mẫu 5 phút | Dự báo tốc độ giao thông | 2018 | |
| PEMS-BAY | Chuỗi các giá trị đo tốc độ của các phương tiện tham gia giao thông được thu từ các cảm biến thuộc hệ thống Performance Measurement System (PeMS) của Caltrans tại vùng vịnh San Francisco. Dữ liệu được ghi theo từng khoảng 5 phút. | 325 cảm biến; dữ liệu trong khoảng 6 tháng; khoảng lấy mẫu 5 phút | Dự báo tốc độ giao thông | 2018 | |
| PeMSD4 | Chuỗi lưu lượng giao thông từ các cảm biến thuộc hệ thống PeMS tại khu vực vịnh San Francisco. Phiên bản benchmark thường dùng gồm dữ liệu của các cảm biến được chọn trên nhiều tuyến đường trong hai tháng đầu năm 2018. | 307 cảm biến trong phiên bản benchmark; 16.992 bước thời gian | Dự báo lưu lượng giao thông | 2019 | |
| PeMSD8 | Chuỗi lưu lượng giao thông từ hệ thống PeMS tại khu vực San Bernardino, California, được ghi từ các cảm biến đặt trên nhiều tuyến đường trong tháng 7 và tháng 8 năm 2016. | 170 cảm biến trong phiên bản benchmark; 17.856 bước thời gian | Dự báo lưu lượng giao thông | 2019 | |
| Traffic4cast | Dữ liệu giao thông đô thị được tổng hợp theo không gian và thời gian từ lượng lớn vị trí GPS của phương tiện. Mỗi bước thời gian mô tả lưu lượng, tốc độ trung bình và hướng di chuyển tại các vùng của thành phố; các phiên bản của cuộc thi bao phủ nhiều thành phố và khoảng thời gian khác nhau. | Phiên bản 2020 gồm Berlin, Istanbul và Moskva với dữ liệu theo khoảng 5 phút trong khoảng một năm; các phiên bản sau mở rộng sang nhiều thành phố | Dự báo trạng thái giao thông theo không gian và thời gian; đánh giá khả năng khái quát giữa các thành phố | 2020 |
Tài chính
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Dow Jones Index | Dữ liệu theo tuần của 30 cổ phiếu thuộc Dow Jones Industrial Average trong hai quý đầu năm 2011, gồm giá mở cửa, đóng cửa, cao nhất, thấp nhất, khối lượng giao dịch và các đại lượng thay đổi theo thời gian. | 750 mẫu; 30 cổ phiếu; 25 tuần | Dự báo biến động giá; phân loại và hồi quy chuỗi tài chính | 2013 | |
| FI-2010 | Dữ liệu sổ lệnh giới hạn tần suất cao của năm cổ phiếu trên thị trường NASDAQ Nordic trong mười ngày giao dịch liên tiếp. Dữ liệu chứa giá và khối lượng ở nhiều mức mua–bán, cùng các biểu diễn chuẩn hóa dùng để dự đoán biến động giá. | Khoảng 4 triệu mẫu chuỗi thời gian; 5 cổ phiếu; 10 ngày giao dịch | Dự báo biến động giá giữa; phân tích sổ lệnh giới hạn | 2018 | |
| CNNpred | Chuỗi dữ liệu theo ngày của năm chỉ số chứng khoán lớn tại Hoa Kỳ, kết hợp giá thị trường với nhiều biến tài chính khác như chỉ báo kỹ thuật, hợp đồng tương lai, giá hàng hóa, các chỉ số thị trường quốc tế và lãi suất tín phiếu kho bạc. | 1.985 ngày từ năm 2010 đến 2017; 5 chỉ số; 84 biến trong phiên bản UCI | Dự đoán hướng biến động thị trường chứng khoán | 2019 |
Tiêu thụ điện
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Individual Household Electric Power Consumption | Các phép đo mức tiêu thụ điện của một hộ gia đình tại Pháp trong gần bốn năm, gồm công suất sử dụng, công suất điện trở, điện áp, cường độ dòng điện và mức tiêu thụ của một số nhóm thiết bị. Các phép đo được ghi mỗi phút. | 2.075.259 phép đo; 47 tháng; 9 biến | Dự báo mức tiêu thụ điện; phân tích chuỗi thời gian | 2006 | |
| ElectricityLoadDiagrams20112014 | Chuỗi mức tiêu thụ điện của hàng trăm khách hàng tại Bồ Đào Nha, được ghi theo từng khoảng 15 phút trong giai đoạn 2011–2014. | 370 khách hàng; khoảng lấy mẫu 15 phút | Dự báo phụ tải điện; phân cụm chuỗi tiêu thụ điện | 2015 | |
| Appliances Energy Prediction | Chuỗi dữ liệu từ một ngôi nhà tiết kiệm năng lượng, gồm mức tiêu thụ điện của thiết bị, nhiệt độ và độ ẩm tại nhiều phòng, cùng các biến thời tiết bên ngoài. | 19.735 phép đo; khoảng lấy mẫu 10 phút; 29 biến | Dự báo mức tiêu thụ điện của thiết bị | 2017 |
Khác
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Numenta Anomaly Benchmark | Bộ benchmark gồm nhiều chuỗi thời gian một biến có dấu thời gian từ các nguồn thực tế và dữ liệu tổng hợp, chẳng hạn mức sử dụng tài nguyên máy chủ, số liệu quảng cáo, cảm biến và lưu lượng mạng. Các khoảng xảy ra bất thường được đánh dấu để đánh giá thuật toán phát hiện bất thường theo thời gian thực. | Hơn 50 chuỗi thời gian trong phiên bản ban đầu | Phát hiện bất thường trong chuỗi thời gian | 2015 |
Dữ liệu dạng bảng
Hệ thống gợi ý
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| MovieLens | Các điểm đánh giá phim do người dùng của hệ thống MovieLens cung cấp, kèm mã người dùng, tên phim, thời gian đánh giá và trong một số phiên bản có thêm nhãn mô tả do người dùng nhập. Bộ dữ liệu được phát hành thành nhiều phiên bản với quy mô khác nhau. | Nhiều phiên bản; MovieLens 25M có khoảng 25 triệu lượt đánh giá của 162.000 người dùng cho 62.000 phim | Hệ thống gợi ý; dự đoán điểm đánh giá | 1997 | |
| Netflix Prize | Các điểm đánh giá phim 1–5 sao của khách hàng Netflix đã được ẩn danh, kèm mã phim và thời điểm đánh giá. Bộ dữ liệu được phát hành cho cuộc thi Netflix Prize và sau đó cũng được dùng trong KDD Cup 2007. | 100.480.507 lượt đánh giá; 480.189 người dùng; 17.770 phim | Hệ thống gợi ý; dự đoán điểm đánh giá | 2006 | |
| Jester Collaborative Filtering Dataset | Các điểm đánh giá ẩn danh của người dùng cho 100 câu chuyện cười, theo thang điểm liên tục từ −10 đến 10. | Khoảng 4,1 triệu lượt đánh giá; 73.421 người dùng; 100 câu chuyện cười | Lọc cộng tác; dự đoán mức độ ưa thích | 2001 | |
| Yahoo! Music KDD Cup 2011 | Các điểm đánh giá của người dùng Yahoo! Music đối với bài hát, album, nghệ sĩ và thể loại âm nhạc. Các mục được tổ chức theo cấu trúc phân cấp và dữ liệu còn chứa thời gian đánh giá. | Hàng trăm triệu lượt đánh giá trong hai tập dữ liệu của KDD Cup 2011 | Hệ thống gợi ý âm nhạc; dự đoán điểm đánh giá và xếp hạng | 2011 |
Y sinh và sức khỏe
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Heart Disease | Dữ liệu lâm sàng của bệnh nhân được thu tại bốn cơ sở ở Hoa Kỳ và châu Âu. Các thuộc tính gồm tuổi tác, giới tính, triệu chứng đau ngực, huyết áp, cholesterol, kết quả điện tâm đồ và các phép đo liên quan đến nghiệm pháp gắng sức. | 303 mẫu trong tập Cleveland thường dùng; 13 đặc trưng | Phân loại bệnh động mạch vành | 1988 | |
| Breast Cancer Wisconsin (Original) | Các đặc trưng mô tả hình thái tế bào lấy từ mẫu chọc hút kim nhỏ của khối u vú, như độ dày cụm tế bào, độ đồng nhất về kích thước và hình dạng tế bào. | 699 mẫu; 9 đặc trưng | Phân loại khối u lành tính hoặc ác tính | 1992 | |
| Breast Cancer Wisconsin (Diagnostic) | Các đặc trưng hình học được tính từ ảnh số hóa của mẫu chọc hút kim nhỏ của khối u vú. Mười đại lượng cơ bản như bán kính, kết cấu, chu vi và diện tích được biểu diễn bằng giá trị trung bình, sai số chuẩn và giá trị cực đại. | 569 mẫu; 30 đặc trưng | Phân loại khối u lành tính hoặc ác tính | 1995 | |
| Diabetic Retinopathy Debrecen | Các đặc trưng được trích từ ảnh đáy mắt trong bộ Messidor, gồm thông tin về tổn thương được phát hiện, các cấu trúc giải phẫu của mắt và các đặc trưng mô tả toàn ảnh. | 1.151 mẫu; 19 đặc trưng | Phát hiện dấu hiệu bệnh võng mạc tiểu đường | 2014 | |
| Parkinson's | Các phép đo âm học được trích từ bản ghi giọng nói của người mắc bệnh Parkinson và người khỏe mạnh. Mỗi hàng tương ứng với một bản ghi giọng nói và gồm các đại lượng về cao độ, độ biến động về cường độ (jitter), độ biến động về biên độ (shimmer) và các đặc trưng phi tuyến. | 195 bản ghi; 31 người | Phân loại bệnh Parkinson | 2008 | |
| Parkinson Speech Dataset | Các đặc trưng tuyến tính và thời gian–tần số được trích từ nhiều loại bản ghi giọng nói như nguyên âm kéo dài, số, từ và câu ngắn của người mắc Parkinson và người khỏe mạnh. | 1.040 mẫu; 40 người trong tập huấn luyện | Phân loại bệnh Parkinson; hồi quy mức độ bệnh | 2013 | |
| Mice Protein Expression | Mức biểu hiện của 77 protein hoặc dạng biến đổi protein trong vỏ não của chuột đối chứng và chuột với ba nhiễm sắc thể trong mỗi tế bào để mô phỏng hội chứng Down. Các nhóm chuột khác nhau về kiểu gen, điều kiện học và việc điều trị bằng memantine. | 1.080 mẫu; 72 con chuột; 77 protein | Phân loại nhóm chuột; phân tích các protein liên quan đến khả năng học | 2015 |
Khoa học tự nhiên
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Abalone | Các phép đo vật lý của bào ngư như chiều dài, đường kính, chiều cao và khối lượng. Tuổi của bào ngư được xác định từ số vòng trên vỏ và được dùng làm giá trị cần dự đoán. | 4.177 mẫu; 8 đặc trưng | Ước lượng tuổi | 1995 | |
| Covertype | Các ô đất rừng 30 × 30 m tại Rừng Quốc gia Roosevelt ở Colorado, được mô tả bằng những thuộc tính địa hình và đất như độ cao, độ dốc, khoảng cách đến nguồn nước, mức che bóng, vùng hoang dã và loại đất. Dữ liệu không sử dụng ảnh viễn thám. | 581.012 mẫu; 54 đặc trưng; 7 loại rừng | Phân loại loại rừng | 1998 | |
| Wine Quality | Các mẫu rượu vang đỏ và trắng Vinho Verde của Bồ Đào Nha, được mô tả bằng các phép đo lý hóa như độ axid, đường dư, chloride, sulfur dioxide, khối lượng riêng, pH, sulfate và nồng độ cồn. Mỗi mẫu có điểm chất lượng do người thử rượu đánh giá. | 6.497 mẫu; 11 đặc trưng đầu vào | Dự đoán chất lượng rượu vang | 2009 | |
| Forest Type Mapping | Các đặc trưng phổ được trích từ ảnh vệ tinh ASTER của một khu vực rừng tại Nhật Bản vào ba thời điểm khác nhau. Mỗi mẫu gồm các giá trị phổ khả kiến và cận hồng ngoại cùng các đại lượng biểu diễn sai khác không gian. | 326 mẫu; 27 đặc trưng; 4 lớp | Phân loại loại rừng | 2012 | |
| HIGGS | Các sự kiện va chạm hạt được mô phỏng bằng phương pháp Monte Carlo để phân biệt tín hiệu của một quá trình tạo boson Higgs với các quá trình nền. Mỗi sự kiện được biểu diễn bằng các đại lượng động học của các hạt cùng một số đặc trưng vật lý tổng hợp. | 11 triệu mẫu; 28 đặc trưng | Phân loại sự kiện vật lý hạt | 2014 | |
| HEPMASS | Các sự kiện va chạm hạt được mô phỏng bằng Monte Carlo, với mục tiêu phân biệt các quá trình tạo hạt giả định mới khỏi nền vật lý chuẩn. Mỗi sự kiện được biểu diễn bằng các đặc trưng động học dạng số. | 10,5 triệu mẫu; 28 đặc trưng | Phân loại sự kiện vật lý hạt | 2016 | |
| Iris | Các mẫu hoa diên vĩ thuộc ba loài, được mô tả bằng chiều dài và chiều rộng của đài hoa và cánh hoa. | 150 mẫu; 4 đặc trưng; 3 lớp | Phân loại loài hoa | 1936 | |
| Wine | Kết quả phân tích hóa học của các mẫu rượu vang được sản xuất từ ba giống nho khác nhau trồng trong cùng một khu vực tại Ý. Các đặc trưng gồm nồng độ cồn, axid malic, magnesium, phenol, flavonoid, cường độ màu và proline. | 178 mẫu; 13 đặc trưng; 3 lớp | Phân loại giống nho dựa trên thành phần hóa học của rượu vang | 1991 |
Kỹ thuật và công nghiệp
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Steel Plates Faults | Các khiếm khuyết trên bề mặt thép không gỉ được biểu diễn bằng các đặc trưng hình học và hình dạng đã trích, rồi chia thành bảy loại lỗi như vết xước, vết bẩn và chỗ lồi. | 1.941 mẫu; 27 đặc trưng; 7 lớp | Phân loại khuyết tật trên tấm thép | 2010 | |
| Airfoil Self-Noise | Các phép đo từ thí nghiệm khí động học và âm học trên cánh NACA 0012 trong đường hầm gió. Mỗi mẫu gồm tần số, góc tấn, chiều dài cung, vận tốc dòng khí và độ dày lớp biên, cùng mức áp suất âm thanh đo được. | 1.503 mẫu; 5 đặc trưng đầu vào | Dự đoán tiếng ồn khí động học | 2014 | |
| Energy Efficiency | Các cấu hình mô phỏng của công trình dân dụng với những thuộc tính thiết kế như độ nhỏ gọn tương đối, diện tích bề mặt, diện tích tường và mái, chiều cao, hướng và diện tích kính. Hai giá trị cần dự đoán là tải sưởi và tải làm mát. | 768 mẫu; 8 đặc trưng đầu vào | Dự đoán tải sưởi và tải làm mát của công trình | 2012 | |
| Gas Turbine CO and NOx Emission | Các phép đo vận hành của một tuabin khí tại Thổ Nhĩ Kỳ được tổng hợp theo giờ, gồm điều kiện môi trường và các biến của quá trình như áp suất, nhiệt độ và công suất. Hai biến đầu ra là nồng độ carbon monoxide và nitrogen oxide trong khí thải. | 36.733 mẫu; 11 biến đo | Dự đoán phát thải CO và NOx | 2019 |
Ô tô
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Automobile | Thông số kỹ thuật và đặc điểm của các mẫu ô tô, gồm hãng sản xuất, loại nhiên liệu, kiểu thân xe, kích thước, khối lượng, đặc điểm động cơ và mức tiêu thụ nhiên liệu. Dữ liệu còn chứa mức rủi ro bảo hiểm và giá xe. | 205 mẫu; 25 đặc trưng | Dự đoán giá xe; phân tích rủi ro bảo hiểm | 1985 | |
| Auto MPG | Các đặc điểm kỹ thuật của ô tô như số xi-lanh, dung tích động cơ, công suất, khối lượng, khả năng tăng tốc và năm sản xuất, kèm mức tiêu thụ nhiên liệu tính theo dặm trên gallon. | 398 mẫu; 7 đặc trưng đầu vào | Dự đoán mức tiêu thụ nhiên liệu | 1983 | |
| Car Evaluation | Các cấu hình ô tô được mô tả bằng sáu thuộc tính phân loại gồm giá mua, chi phí bảo dưỡng, số cửa, sức chứa hành khách, kích thước khoang hành lý và mức an toàn. Nhãn biểu thị mức độ chấp nhận của xe. | 1.728 mẫu; 6 đặc trưng; 4 lớp | Phân loại mức độ chấp nhận của ô tô | 1988 |
Kinh tế và tài chính
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Statlog (Australian Credit Approval) | Các hồ sơ xin cấp tín dụng với cả thuộc tính số và thuộc tính phân loại. Tên và giá trị của các thuộc tính đã được ẩn hoặc mã hóa để bảo vệ thông tin cá nhân. | 690 mẫu; 14 đặc trưng | Phân loại hồ sơ tín dụng | 1987 | |
| Statlog (German Credit Data) | Hồ sơ người vay được mô tả bằng các thuộc tính như tình trạng tài khoản, thời hạn và mục đích khoản vay, lịch sử tín dụng, hạn mức tín dụng, việc làm và tình trạng nhà ở. Mỗi hồ sơ được phân thành rủi ro tín dụng tốt hoặc xấu. | 1.000 mẫu; 20 đặc trưng | Đánh giá rủi ro tín dụng | 1994 | |
| Default of Credit Card Clients | Hồ sơ khách hàng thẻ tín dụng tại Đài Loan, gồm hạn mức tín dụng, thông tin nhân khẩu học, lịch sử trả nợ, số tiền trên hóa đơn và các khoản thanh toán trong sáu tháng trước đó. | 30.000 khách hàng; 23 đặc trưng | Dự đoán khả năng vỡ nợ thẻ tín dụng | 2009 | |
| Bank Marketing | Dữ liệu từ các chiến dịch tiếp thị trực tiếp qua điện thoại của một ngân hàng Bồ Đào Nha. Mỗi mẫu mô tả một khách hàng và lần liên hệ, với mục tiêu xác định người đó có đăng ký tiền gửi có kỳ hạn hay không. | 45.211 mẫu; 16 đặc trưng trong phiên bản đầy đủ | Dự đoán phản hồi chiến dịch tiếp thị ngân hàng | 2012 |
Xã hội
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Adult | Các hồ sơ được trích từ dữ liệu điều tra dân số Hoa Kỳ, gồm những thuộc tính như tuổi, trình độ học vấn, nghề nghiệp, tình trạng hôn nhân, số giờ làm việc và thu nhập. | 48.842 mẫu; 14 đặc trưng | Dự đoán thu nhập hằng năm trên hoặc không quá 50.000 USD | 1996 | |
| Census-Income (KDD) | Các hồ sơ được trích từ Current Population Surveys của Cục Điều tra Dân số Hoa Kỳ năm 1994 và 1995, gồm các biến về nhân khẩu học, việc làm, giáo dục và hộ gia đình. Mỗi mẫu còn có trọng số biểu thị số người trong dân số mà hồ sơ đại diện. | 299.285 mẫu; 41 đặc trưng | Dự đoán mức thu nhập | 2000 | |
| Student Performance | Dữ liệu học sinh tại hai trường trung học ở Bồ Đào Nha, gồm điểm số, thông tin nhân khẩu học, hoàn cảnh xã hội, gia đình và các yếu tố liên quan đến trường học. Hai tập con tương ứng với môn Toán và tiếng Bồ Đào Nha. | 395 học sinh môn Toán; 649 học sinh môn tiếng Bồ Đào Nha | Dự đoán kết quả học tập | 2008 | |
| Teaching Assistant Evaluation | Các đánh giá chất lượng giảng dạy của các trợ giảng tại Khoa Thống kê, Đại học Wisconsin–Madison trong ba học kỳ chính và hai học kỳ hè. Mỗi mẫu mô tả một lần phân công trợ giảng bằng các thuộc tính như giảng viên, khóa học, học kỳ và quy mô lớp. | 151 mẫu; 5 đặc trưng | Phân loại mức đánh giá giảng dạy | 1997 | |
| Balance Scale | Dữ liệu tổng hợp được tạo để mô hình hóa kết quả của một thí nghiệm về cân thăng bằng. Mỗi mẫu xác định khối lượng và khoảng cách ở hai phía của cân, với nhãn cho biết cân nghiêng sang trái, sang phải hoặc giữ cân bằng. | 625 mẫu; 4 đặc trưng; 3 lớp | Phân loại trạng thái cân | 1994 |
Khác
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Letter Recognition | Các chữ cái in hoa trong bảng chữ cái Latinh được biểu diễn bằng các đặc trưng số trích từ ảnh ký tự, như vị trí, kích thước và các thống kê về phân bố pixel. | 20.000 mẫu; 16 đặc trưng; 26 lớp | Nhận dạng chữ cái | 1991 | |
| Spambase | Các thư điện tử được biểu diễn bằng những đặc trưng đã trích như tần suất xuất hiện của từ và ký tự, cùng các thống kê về chuỗi chữ in hoa. | 4.601 mẫu; 57 đặc trưng | Phân loại thư rác | 1999 |
Dữ liệu đồ thị
Mạng xã hội
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Facebook Social Circles | Các mạng lân cận của người dùng Facebook, trong đó mỗi nút biểu thị người dùng và các cạnh biểu thị quan hệ bạn bè giữa họ. Dữ liệu còn gồm các thuộc tính hồ sơ đã ẩn danh và các nhóm bạn bè do người dùng xác định. | 4.039 nút; 88.234 cạnh | Phát hiện cộng đồng; dự đoán liên kết; học biểu diễn nút | 2012 | |
| Epinions Social Network | Mạng có hướng giữa người dùng của trang đánh giá Epinions, trong đó một cạnh biểu thị việc một người dùng tuyên bố tin cậy một người dùng khác. | 75.879 nút; 508.837 cạnh | Dự đoán liên kết; phân tích độ tin cậy; phân tích mạng xã hội | 2003 | |
| Slashdot Social Network | Mạng người dùng của trang tin công nghệ Slashdot, trong đó các quan hệ được tạo thông qua chức năng Slashdot Zoo cho phép người dùng đánh dấu người khác là bạn hoặc đối thủ. Phiên bản tháng 2 năm 2009 chứa mạng quan hệ giữa hơn 82 nghìn người dùng. | 82.168 nút; 948.464 cạnh | Phân tích cấu trúc cộng đồng; dự đoán liên kết | 2009 | |
| Pokec Social Network | Mạng xã hội Pokec tại Slovakia, gồm các quan hệ bạn bè có hướng và thông tin hồ sơ đã được ẩn danh như tuổi, giới tính, khu vực, học vấn và sở thích. | 1.632.803 nút; 30.622.564 cạnh | Phân tích mạng xã hội; dự đoán liên kết; dự đoán thuộc tính nút | 2012 | |
| LiveJournal Social Network | Mạng quan hệ giữa người dùng LiveJournal, một nền tảng blog và cộng đồng trực tuyến. Các nút biểu thị tài khoản người dùng và cạnh có hướng biểu thị quan hệ bạn bè được khai báo giữa các thành viên. | 4.847.571 nút; 68.993.773 cạnh | Phát hiện cộng đồng; phân tích cấu trúc mạng; dự đoán liên kết | 2006 | |
| Gowalla | Mạng xã hội dựa trên vị trí của Gowalla, gồm quan hệ bạn bè giữa người dùng và các lần check-in có dấu thời gian và tọa độ địa lý. | 196.591 nút; 950.327 cạnh; 6.442.890 lượt check-in | Dự đoán liên kết; dự đoán vị trí; phân tích quan hệ giữa tình bạn và di chuyển | 2011 |
Hóa học
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| MUTAG | Tập hợp các hợp chất hóa học có cấu trúc được biểu diễn dưới dạng đồ thị, trong đó nút là nguyên tử và cạnh là liên kết hóa học. Mỗi phân tử được gán nhãn theo khả năng gây đột biến. | 188 đồ thị; trung bình 17,9 nút và 19,8 cạnh mỗi đồ thị; 2 lớp | Phân loại đồ thị; dự đoán khả năng gây đột biến | 2020 | |
| NCI1 | Các hợp chất hóa học được biểu diễn thành đồ thị phân tử và gán nhãn theo kết quả sàng lọc khả năng ức chế sự phát triển của tế bào ung thư trong chương trình của Viện Ung thư Quốc gia Hoa Kỳ. | 4.110 đồ thị; trung bình 29,9 nút và 32,3 cạnh; 2 lớp | Phân loại đồ thị; dự đoán hoạt tính sinh học của hợp chất | 2020 | |
| ZINC | Các phân tử hữu cơ giống thuốc từ cơ sở dữ liệu ZINC được biểu diễn dưới dạng đồ thị với nguyên tử là nút và liên kết hóa học là cạnh. Phiên bản benchmark thường dùng gồm 12.000 phân tử và yêu cầu dự đoán một tính chất hóa học liên tục. | 12.000 đồ thị trong phiên bản benchmark; 10.000 huấn luyện, 1.000 xác thực, 1.000 kiểm thử | Hồi quy đồ thị; dự đoán tính chất phân tử | 2020 |
Sinh học
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| PP-Pathways | Mạng tương tác protein–protein ở người, trong đó các nút biểu thị protein và các cạnh biểu thị những tương tác vật lý đã được xác nhận bằng thực nghiệm. Mạng được sử dụng để nghiên cứu cấu trúc của các con đường liên quan đến bệnh. | 21.557 nút; 342.353 cạnh | Dự đoán liên kết; phát hiện con đường bệnh; phân tích cấu trúc mạng protein | 2018 | |
| PPT-OhmNet | Tập hợp các mạng tương tác protein–protein đặc hiệu theo mô ở người. Mỗi lớp mạng tương ứng với một mô, với các nút là protein và các cạnh là tương tác vật lý được xác định là hoạt động trong mô đó. | 4.510 protein; 70.338 cạnh trong mạng đa lớp; 107 mô | Dự đoán chức năng protein theo mô; học biểu diễn nút trên mạng đa lớp | 2017 | |
| PP-Decagon | Mạng liên kết protein–protein ở người, gồm cả tương tác vật lý trực tiếp và các liên hệ chức năng gián tiếp. Bộ dữ liệu là thành phần protein của mạng đa phương thức Decagon dùng để mô hình hóa tác dụng phụ của việc kết hợp nhiều loại thuốc. | 19.081 nút; 715.612 cạnh | Dự đoán liên kết; học biểu diễn protein; dự đoán tác dụng phụ của phối hợp thuốc | 2018 | |
| ChG-TargetDecagon | Mạng hai phía giữa thuốc và protein đích, trong đó mỗi cạnh biểu thị một tương tác thuốc–protein đã được xác nhận bằng thực nghiệm hoặc nghiên cứu dược lý. | 3.932 nút, gồm 284 thuốc và 3.648 gene/protein; 18.690 cạnh | Dự đoán đích tác dụng của thuốc; dự đoán liên kết thuốc–protein | 2018 | |
| PP-Miner | Tập hợp các mạng liên kết protein–protein của nhiều loài, gồm tương tác vật lý trực tiếp và các liên hệ chức năng như đồng biểu hiện, cùng con đường sinh học và phức hợp protein. Dữ liệu được trích từ STRING phiên bản 10.5. | Khoảng 8,25 triệu protein; 1,85 tỷ cạnh; 2.031 loài | Dự đoán tương tác protein; học biểu diễn protein; phân tích mạng sinh học giữa nhiều loài | 2017 | |
| ENZYMES | Các protein được biểu diễn dưới dạng đồ thị dựa trên cấu trúc bậc ba; các nút tương ứng với cấu trúc thứ cấp của protein và các cạnh mô tả quan hệ không gian giữa chúng. Mỗi đồ thị được gán vào một trong sáu lớp enzyme. | 600 đồ thị; trung bình 32,6 nút và 62,1 cạnh; 6 lớp | Phân loại đồ thị; phân loại enzyme | 2020 | |
| ogbg-molhiv | Các phân tử được biểu diễn thành đồ thị nguyên tử–liên kết và gán nhãn theo khả năng ức chế sự nhân lên của HIV. Bộ dữ liệu được OGB chuẩn hóa từ một tác vụ trong MoleculeNet. | 41.127 đồ thị | Phân loại đồ thị; dự đoán hoạt tính chống HIV | 2020 | |
| ogbg-molpcba | Các hợp chất từ PubChem BioAssay được biểu diễn thành đồ thị phân tử và gán nhãn cho nhiều phép thử sinh học khác nhau. | 437.929 đồ thị; 128 tác vụ phân loại nhị phân | Phân loại đồ thị đa tác vụ; dự đoán hoạt tính sinh học | 2020 | |
| ogbg-ppa | Tập hợp các mạng liên kết protein của nhiều loài, trong đó mỗi đồ thị biểu diễn mạng liên kết protein của một loài và các cạnh có đặc trưng mô tả nhiều loại liên hệ giữa protein. Mục tiêu là xác định nhóm phân loại sinh học của loài tạo ra mạng. | 1.581 đồ thị; 37 lớp | Phân loại đồ thị; phân loại nhóm sinh vật | 2020 |
Đồ thị tri thức
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| FB15k-237 | Một tập con của Freebase được tạo từ FB15k sau khi loại bỏ các quan hệ dư thừa và nhiều cặp quan hệ nghịch đảo có thể gây rò rỉ giữa tập huấn luyện và kiểm thử. Các bộ ba biểu diễn quan hệ giữa các thực thể thuộc nhiều lĩnh vực như người, địa điểm, phim và thể thao. | 14.541 thực thể; 237 loại quan hệ; 310.116 bộ ba | Hoàn thiện đồ thị tri thức; dự đoán liên kết | 2015 | |
| WN18RR | Một tập con của WordNet được tạo từ benchmark WN18 bằng cách loại bỏ các quan hệ nghịch đảo gây rò rỉ giữa dữ liệu huấn luyện và kiểm thử. Các nút tương ứng với các tập hợp từ đồng nghĩa (synset) của WordNet và các cạnh biểu thị những quan hệ từ vựng giữa chúng. | 40.943 thực thể; 11 loại quan hệ; 93.003 bộ ba | Hoàn thiện đồ thị tri thức; dự đoán liên kết | 2018 | |
| YAGO3-10 | Một tập con của đồ thị tri thức YAGO3 chỉ giữ các thực thể tham gia ít nhất mười quan hệ. Phần lớn các bộ ba mô tả thuộc tính của con người, chẳng hạn quốc tịch, giới tính và nghề nghiệp. | 123.182 thực thể; 37 loại quan hệ; 1.089.040 bộ ba | Hoàn thiện đồ thị tri thức; dự đoán liên kết | 2018 | |
| Wikidata5M | Đồ thị tri thức quy mô lớn được xây dựng từ bản kết xuất Wikidata và Wikipedia tiếng Anh tháng 7 năm 2019. Mỗi thực thể được liên kết với phần mô tả lấy từ bài Wikipedia tương ứng, cho phép đánh giá cả trên các thực thể đã xuất hiện và chưa xuất hiện trong quá trình huấn luyện. | 4.594.485 thực thể; 822 loại quan hệ; 20.624.575 bộ ba | Hoàn thiện đồ thị tri thức; dự đoán liên kết quy nạp; học biểu diễn thực thể | 2021 |
Mạng trích dẫn nghiên cứu
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Cora | Mạng trích dẫn các bài báo về học máy, trong đó mỗi nút là một bài báo và mỗi cạnh biểu thị quan hệ trích dẫn. Mỗi bài được biểu diễn bằng vector nhị phân cho biết sự xuất hiện của các từ và được gán vào một trong bảy chủ đề. | 2.708 nút; 5.429 cạnh; 1.433 đặc trưng; 7 lớp | Phân loại nút; học nửa giám sát trên đồ thị | 2000 | |
| CiteSeer | Mạng trích dẫn các bài báo khoa học, trong đó các nút là tài liệu và các cạnh biểu thị quan hệ trích dẫn. Nội dung mỗi bài được biểu diễn bằng vector từ và các bài báo được chia thành sáu chủ đề. | 3.327 nút; 4.732 cạnh; 3.703 đặc trưng; 6 lớp | Phân loại nút; học nửa giám sát trên đồ thị | 2008 | |
| PubMed | Mạng trích dẫn các bài báo y sinh về bệnh tiểu đường trong cơ sở dữ liệu PubMed. Mỗi bài báo là một nút, các cạnh biểu thị trích dẫn và mỗi nút có vector đặc trưng dựa trên tần suất từ, cùng nhãn chỉ một trong ba nhóm chủ đề. | 19.717 nút; 44.338 cạnh; 500 đặc trưng; 3 lớp | Phân loại nút; học nửa giám sát trên đồ thị | 2008 | |
| ogbn-arxiv | Mạng trích dẫn có hướng của các bài báo khoa học máy tính trên arXiv được lập chỉ mục trong Microsoft Academic Graph. Mỗi nút là một bài báo, mỗi cạnh biểu thị một trích dẫn và mỗi nút có vector 128 chiều được tạo từ tiêu đề và tóm tắt. | 169.343 nút; 1.166.243 cạnh; 40 lớp | Phân loại chủ đề bài báo; phân loại nút | 2020 | |
| ogbn-papers100M | Mạng trích dẫn quy mô lớn của các bài báo khoa học máy tính được lập chỉ mục trong Microsoft Academic Graph. Mỗi nút là một bài báo, mỗi cạnh có hướng biểu thị một quan hệ trích dẫn và mỗi bài có vector đặc trưng 128 chiều được tạo từ tiêu đề và tóm tắt. | 111.059.956 nút; 1.615.685.872 cạnh; 172 lớp | Phân loại chủ đề bài báo; phân loại nút; đánh giá khả năng mở rộng của mô hình đồ thị | 2020 |
Mã nguồn và nhật ký phần mềm
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| CodeSearchNet Corpus | Mã nguồn từ các kho phần mềm nguồn mở trên GitHub, gồm các hàm và tài liệu đi kèm thuộc sáu ngôn ngữ lập trình: Go, Java, JavaScript, PHP, Python và Ruby. | Khoảng 6 triệu hàm; 6 ngôn ngữ lập trình | Tìm kiếm mã nguồn; sinh mô tả mã; học biểu diễn mã nguồn | 2019 | |
| CodeXGLUE | Bộ benchmark tổng hợp nhiều tập dữ liệu về mã nguồn cho các bài toán hiểu và tạo sinh chương trình, bao gồm phát hiện clone và lỗi, tìm kiếm mã, tạo sinh và hoàn thiện mã, dịch giữa các ngôn ngữ lập trình, sửa mã và tạo sinh mô tả bằng ngôn ngữ tự nhiên. | 14 tập dữ liệu; 10 tác vụ | Hiểu mã nguồn; sinh mã; phát hiện lỗi; tìm kiếm mã; dịch và sửa mã | 2021 | |
| The Stack | Mã nguồn quy mô lớn được thu thập từ các kho phần mềm công khai và lọc theo giấy phép cho phép phân phối. | Khoảng 3,1 TB mã nguồn; 30 ngôn ngữ lập trình trong phiên bản được công bố ban đầu | Mô hình hóa mã nguồn; hoàn thiện mã; sinh chương trình; tiền huấn luyện mô hình ngôn ngữ | 2022 | |
| HumanEval | Bộ bài toán lập trình Python, mỗi bài gồm chữ ký hàm, tài liệu mô tả yêu cầu và các kiểm thử dùng để đánh giá tính đúng đắn của chương trình được sinh ra. | 164 bài toán lập trình | Sinh mã từ mô tả ngôn ngữ tự nhiên; đánh giá tính đúng đắn chức năng | 2021 | |
| Defects4J | Tập hợp các lỗi thực tế có thể tái tạo trong các dự án Java nguồn mở. Mỗi lỗi đi kèm phiên bản chương trình bị lỗi và phiên bản đã sửa, cùng bộ kiểm thử giúp tái tạo hành vi lỗi. | 357 lỗi thuộc 5 dự án trong phiên bản được công bố ban đầu | Kiểm thử phần mềm; định vị lỗi; sửa lỗi tự động; dự đoán lỗi | 2014 | |
| Loghub | Bộ sưu tập nhật ký thực tế từ nhiều loại hệ thống phần mềm, gồm hệ thống phân tán, siêu máy tính, hệ điều hành, thiết bị di động, ứng dụng máy chủ và phần mềm độc lập. Một số tập con có nhãn để xác định sự bất thường. | 19 tập dữ liệu; tổng dung lượng hơn 77 GB | Phân tích nhật ký; phân tích cú pháp log; phát hiện bất thường; chẩn đoán lỗi | 2020 | |
| Loghub-2.0 | Bộ benchmark nhật ký hệ thống được xây dựng để khắc phục hạn chế về quy mô và tính đại diện của Loghub khi đánh giá các thuật toán phân tích cú pháp log. Các log được lấy từ nhiều hệ thống phần mềm thực tế và được gán nhãn mẫu log. | 14 tập dữ liệu; trung bình khoảng 3,6 triệu dòng log mỗi tập | Phân tích cú pháp nhật ký; đánh giá thuật toán phân tích log | 2023 |
Đa phương thức
Hình ảnh–văn bản
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| Flickr30k | Các ảnh chụp từ Flickr, mỗi ảnh đi kèm năm câu mô tả bằng tiếng Anh do con người viết. Dữ liệu chủ yếu mô tả người, vật thể, hoạt động và sự kiện trong các cảnh đời thường. | 31.783 ảnh; 158.915 câu mô tả | Sinh mô tả ảnh; truy hồi ảnh–văn bản; học biểu diễn đa phương thức | 2014 | |
| Visual Genome | Các ảnh cảnh thực tế được gán chú thích dày đặc về vật thể, thuộc tính, quan hệ giữa các vật thể, vùng ảnh và mô tả bằng ngôn ngữ tự nhiên. Các chú thích có thể được biểu diễn dưới dạng đồ thị cảnh liên kết nội dung hình ảnh với ngôn ngữ. | 108.077 ảnh; hàng triệu mô tả vùng, vật thể, thuộc tính và quan hệ | Sinh mô tả ảnh; sinh đồ thị cảnh; hiểu quan hệ thị giác–ngôn ngữ; hỏi đáp trực quan | 2017 | |
| VQA v2 | Các câu hỏi bằng ngôn ngữ tự nhiên về ảnh cùng câu trả lời do con người cung cấp. Phiên bản thứ hai được xây dựng để giảm khả năng mô hình đoán câu trả lời chỉ từ thiên lệch ngôn ngữ bằng cách ghép các câu hỏi tương tự với những ảnh có câu trả lời khác nhau. | Khoảng 204.000 ảnh; 1,1 triệu câu hỏi; hơn 11 triệu câu trả lời | Hỏi đáp trực quan | 2017 | |
| CLEVR | Các ảnh tổng hợp chứa những vật thể 3D đơn giản, đi kèm câu hỏi được sinh tự động về thuộc tính, vị trí, số lượng và quan hệ giữa các vật thể. Mỗi câu hỏi còn có biểu diễn chương trình chức năng mô tả chuỗi suy luận cần thực hiện. | 100.000 ảnh; khoảng 1 triệu câu hỏi | Hỏi đáp trực quan; suy luận kết hợp; đánh giá khả năng suy luận thị giác | 2017 | |
| GQA | Các câu hỏi và câu trả lời về ảnh thực tế được tạo từ các đồ thị cảnh của Visual Genome. Mỗi câu hỏi đi kèm biểu diễn ngữ nghĩa có cấu trúc, cho phép đánh giá nhiều bước suy luận về vật thể, thuộc tính và quan hệ. | 113.018 ảnh; khoảng 22 triệu câu hỏi | Hỏi đáp trực quan; suy luận kết hợp; đánh giá tính nhất quán | 2019 | |
| Conceptual Captions | Các cặp ảnh và văn bản thay thế được thu thập tự động từ các trang web; văn bản được xử lý và khái quát hóa một số thực thể, tạo dữ liệu quy mô lớn nhưng nhiễu hơn các bộ mô tả ảnh được gán nhãn thủ công. | Khoảng 3,3 triệu cặp ảnh–văn bản huấn luyện | Sinh mô tả ảnh; tiền huấn luyện thị giác–ngôn ngữ | 2018 | |
| Wikipedia-based Image Text Dataset | Các cặp ảnh–văn bản được trích từ Wikipedia đa ngôn ngữ, kết hợp ảnh với văn bản liên quan trong bài viết và thông tin về thực thể. Bộ dữ liệu được thiết kế cho học đa phương thức và đa ngôn ngữ. | 37,6 triệu mẫu ảnh–văn bản; 11,5 triệu ảnh duy nhất; 108 ngôn ngữ | Tiền huấn luyện đa phương thức; truy hồi ảnh–văn bản; học đa ngôn ngữ | 2021 | |
| LAION-5B | Bộ dữ liệu quy mô lớn gồm các cặp ảnh và văn bản thay thế thu thập từ web, sau đó được lọc theo mức tương đồng giữa ảnh và văn bản bằng mô hình CLIP (contrastive language-image pre-training). Bộ dữ liệu gồm nhiều tập con theo ngôn ngữ và mức độ an toàn của nội dung. | 5,85 tỷ cặp ảnh–văn bản | Tiền huấn luyện mô hình thị giác–ngôn ngữ; sinh ảnh từ văn bản; truy hồi ảnh–văn bản | 2022 |
Video–âm thanh–văn bản
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| CMU-MOSI | Các đoạn video độc thoại lấy từ video đánh giá phim trên YouTube, gồm hình ảnh người nói, tín hiệu âm thanh và bản chép lời. Mỗi đoạn được gán điểm cường độ cảm xúc từ −3 đến 3. | 2.199 đoạn; 93 video | Phân tích cảm xúc đa phương thức; hồi quy cường độ cảm xúc | 2016 | |
| CMU-MOSEI | Các đoạn phát biểu lấy từ video trực tuyến của hơn một nghìn người nói về nhiều chủ đề khác nhau. Mỗi mẫu kết hợp bản chép lời, âm thanh và biểu hiện hình ảnh, đồng thời có nhãn cảm xúc và cường độ cảm xúc. | 23.453 đoạn; hơn 1.000 người nói; 250 chủ đề | Phân tích cảm xúc đa phương thức; nhận dạng cảm xúc | 2018 | |
| MELD | Các đoạn hội thoại nhiều người từ loạt phim Friends, trong đó mỗi phát ngôn có video, âm thanh và bản chép lời, cùng nhãn cảm xúc và sắc thái tích cực, tiêu cực hoặc trung tính. | Khoảng 13.000 phát ngôn; 1.433 đoạn hội thoại | Nhận dạng cảm xúc trong hội thoại; phân tích cảm xúc đa phương thức | 2019 | |
| HowTo100M | Các video hướng dẫn có lời thuyết minh được thu thập từ web, chia thành các đoạn ngắn và ghép với văn bản lấy từ phụ đề tự động của lời nói. | 1,22 triệu video; 136 triệu đoạn video; khoảng 134.000 giờ | Tiền huấn luyện video–ngôn ngữ; truy hồi video–văn bản; học biểu diễn đa phương thức | 2019 | |
| CH-SIMS | Các đoạn video tiếng Trung lấy từ phim điện ảnh, phim truyền hình và chương trình giải trí, kết hợp hình ảnh, âm thanh và lời thoại. Ngoài nhãn cảm xúc chung cho cả mẫu đã phương thức, mỗi phương thức còn được gán nhãn cảm xúc riêng. | 2.281 đoạn video; 60 video nguồn | Phân tích cảm xúc đơn phương thức và đa phương thức | 2020 |
Văn bản–đồ thị/cấu trúc
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| WebNLG | Các tập bộ ba RDF lấy từ DBpedia được ghép với những câu hoặc đoạn văn diễn đạt cùng nội dung bằng ngôn ngữ tự nhiên. Bộ dữ liệu được xây dựng để đánh giá khả năng chuyển dữ liệu có cấu trúc thành văn bản. | Hàng nghìn tập bộ ba RDF và nhiều cách diễn đạt bằng văn bản | Sinh văn bản từ đồ thị; diễn đạt dữ liệu RDF bằng ngôn ngữ tự nhiên | 2017 | |
| T-REx | Các câu trong phần mở đầu của bài Wikipedia được căn chỉnh với các bộ ba trong Wikidata biểu diễn những thực thể và quan hệ được đề cập trong văn bản. | 11 triệu bộ ba; 3,09 triệu phần mở đầu Wikipedia; 6,2 triệu câu | Trích xuất quan hệ; liên kết thực thể; căn chỉnh văn bản–đồ thị tri thức; hoàn thiện cơ sở tri thức | 2018 | |
| WikiTableQuestions | Các câu hỏi bằng ngôn ngữ tự nhiên được ghép với bảng bán cấu trúc lấy từ Wikipedia và câu trả lời có thể được suy ra từ nội dung bảng. Nhiều câu hỏi yêu cầu kết hợp nhiều phép toán hoặc so sánh giữa các ô. | 22.033 câu hỏi; 2.108 bảng | Hỏi đáp trên bảng; phân tích ngữ nghĩa | 2015 | |
| WikiSQL | Các câu hỏi bằng ngôn ngữ tự nhiên về những bảng lấy từ Wikipedia, đi kèm truy vấn SQL tương ứng. Mỗi ví dụ gắn một câu hỏi với cấu trúc của bảng và một truy vấn dùng để lấy câu trả lời. | 80.654 cặp câu hỏi–SQL; 24.241 bảng | Chuyển văn bản thành SQL; phân tích ngữ nghĩa; giao diện ngôn ngữ tự nhiên cho cơ sở dữ liệu | 2017 | |
| Spider | Các câu hỏi ngôn ngữ tự nhiên được ghép với truy vấn SQL trên nhiều cơ sở dữ liệu quan hệ có nhiều bảng và lược đồ khác nhau. Tập huấn luyện và kiểm thử sử dụng các cơ sở dữ liệu khác nhau để đánh giá khả năng khái quát hóa sang lược đồ chưa gặp. | 10.181 câu hỏi; 5.693 truy vấn SQL riêng biệt; 200 cơ sở dữ liệu; 138 lĩnh vực | Chuyển văn bản thành SQL; phân tích ngữ nghĩa trên nhiều miền | 2018 | |
| ToTTo | Các bảng Wikipedia với một số ô được đánh dấu, đi kèm một câu tiếng Anh diễn đạt thông tin chứa trong các ô đó. Các câu đích được biên tập để vừa tự nhiên vừa bám sát dữ liệu trong bảng. | Hơn 120.000 mẫu huấn luyện | Sinh văn bản từ bảng; sinh văn bản có điều kiện từ dữ liệu có cấu trúc | 2020 |
Khác
| Bộ dữ liệu | Mô tả | Quy mô | Tác vụ | Năm | Nguồn |
|---|---|---|---|---|---|
| RAVDESS | Các bản ghi lời nói và bài hát thể hiện cảm xúc của 24 diễn viên chuyên nghiệp, được cung cấp dưới dạng nghe nhìn, chỉ âm thanh và chỉ video. Các biểu cảm được gán nhãn theo loại cảm xúc và cường độ. | 7.356 tệp; 24 diễn viên | Nhận dạng cảm xúc từ giọng nói và khuôn mặt; học đa phương thức âm thanh–video | 2018 | |
| FUNSD | Các biểu mẫu giấy đã quét với chú thích cho từ, thực thể ngữ nghĩa và quan hệ giữa các thực thể. Mỗi mẫu kết hợp hình ảnh tài liệu, nội dung văn bản và vị trí không gian của văn bản trên trang. | 199 biểu mẫu; 31.485 từ; 9.707 thực thể; 5.304 quan hệ | Hiểu biểu mẫu; nhận dạng thực thể; liên kết thực thể; phân tích bố cục tài liệu | 2019 | |
| DocVQA | Các ảnh tài liệu được ghép với câu hỏi bằng ngôn ngữ tự nhiên và câu trả lời do con người gán nhãn. Việc trả lời thường yêu cầu kết hợp nhận dạng văn bản với hiểu bố cục và cấu trúc của tài liệu. | Hơn 12.000 ảnh tài liệu; 50.000 câu hỏi | Hỏi đáp trên tài liệu; hiểu tài liệu đa phương thức | 2021 | |
| Ego-Exo4D | Các hoạt động có kỹ năng được ghi đồng thời từ camera góc nhìn thứ nhất và nhiều camera bên ngoài. Dữ liệu góc nhìn thứ nhất còn có âm thanh nhiều kênh, cảm biến quán tính, theo dõi ánh mắt, tư thế đầu và thông tin hình học 3D của môi trường; một phần dữ liệu đi kèm chú thích ngôn ngữ. | Hơn 1.400 giờ video; 839 người tham gia; 13 thành phố | Hiểu hoạt động; chuyển đổi giữa góc nhìn thứ nhất và thứ ba; học đa phương thức và đa góc nhìn | 2024 |
Tham khảo
Thống kê chỉ số