Cấp phép tập dữ liệu: nguồn gốc, kiểm toán và quyền sở hữu

Guides

Bởi Win.AI Editorial

Engineer team at a desk reviewing printed dataset cards and external hard drives with labeled folders for sources and licenses

Cấp phép tập dữ liệu là kiểm soát có sức ảnh hưởng lớn nhất mà các kỹ sư có thể áp dụng để giảm thiểu rủi ro pháp lý và danh tiếng khi đào tạo các mô hình. Cấp phép rõ ràng, nguồn gốc được ghi nhận và các cuộc kiểm toán định kỳ biến một tập hợp dữ liệu mơ hồ thành một sản phẩm có thể kiểm toán mà các đội ngũ có thể bảo vệ trước tòa án và truyền thông.

CẤP PHÉP TẬP DỮ LIỆU: CÁC LOẠI VÀ Ý NGHĨA CỦA CHÚNG

Các giấy phép trả lời một câu hỏi cụ thể: người giữ quyền cho phép sử dụng nào. Creative Commons trình bày sáu giấy phép CC chính và CC0, sự cống hiến cho miền công cộng, mỗi loại đánh đổi giữa việc ghi công, quyền thương mại và quyền remix. Một nguồn CC BY hoặc CC0 rất dễ hiểu cho việc đào tạo mô hình, một nguồn CC BY-SA tạo ra nghĩa vụ chia sẻ mà có thể truyền cho các tập dữ liệu phát sinh, và các điều khoản NC hoặc ND có thể cấm các sử dụng thương mại hoặc thích ứng. Khi một tập dữ liệu được gán là "công cộng" nhưng thiếu siêu dữ liệu giấy phép có thể đọc bằng máy, bạn vẫn phải chịu rủi ro pháp lý vì ranh giới cho phép là mơ hồ. Ghi tên giấy phép, phiên bản và người cấp phép trong bản khai tập dữ liệu để các đội ngũ ở phía sau có thể đưa ra quyết định nhị phân về việc tái sử dụng. Điều này không phải là lý thuyết. Creative Commons cung cấp siêu dữ liệu có thể đọc bằng máy và một tài liệu tiêu chuẩn mà các đội ngũ nên nhúng cùng với các tệp.

GHI NHẬN NGUỒN GỐC VÀ THỰC HIỆN KIỂM TOÁN

Nguồn gốc không phải là một đoạn trong README. Sử dụng các tiêu chuẩn hiện có: W3C PROV xác định các thực thể, hoạt động, và tác nhân cho nguồn gốc, trong khi sơ đồ siêu dữ liệu của DataCite cung cấp các trường cho người tạo, ngày tháng và định danh vĩnh viễn; DataCite đã phát hành các bản cập nhật cho sơ đồ của mình vào năm 2026 để dễ dàng ghi nhận các mối quan hệ cấp tập dữ liệu. Về thực tiễn, ghi lại ba điều tối thiểu cho từng tài sản: URL hoặc DOI nguồn, định danh giấy phép và phiên bản, và bước trong quy trình đưa vào mà đã thu thập hoặc chuyển đổi tài sản. "Datasheets for Datasets" của Gebru và cộng sự vẫn là mẫu tốt nhất cho thẻ tập dữ liệu có thể đọc bởi con người; Nhãn Dinh Dưỡng Tập Dữ liệu của Dự án Dinh Dưỡng Dữ liệu là một lựa chọn gọn gàng cho việc tiết lộ tập trung vào rủi ro.

Đối với một cuộc kiểm toán, kết hợp các kiểm tra xác định và các thăm dò thống kê. Các kiểm tra xác định bao gồm các bản hash tệp, thẻ giấy phép nhúng và một danh sách các dấu thời gian nguồn. Các thăm dò thống kê bao gồm việc lấy mẫu văn bản hoặc hình ảnh và chạy kiểm tra độ tương đồng so với các tập hợp dữ liệu có bản quyền đã biết sử dụng MinHash hoặc hàng xóm gần nhất nhúng. Một cuộc kiểm toán thực tiễn tìm ra một phần nhỏ hồ sơ mang rủi ro pháp lý lớn nhất; tập trung nỗ lực ở đó.

Chúng tôi đã quan sát thấy ba thất bại phổ biến trong thực tế. Thứ nhất, các truy cập công khai thường thiếu các trường giấy phép. Thứ hai, các đội ngũ nhầm lẫn "có sẵn để xem" với "được cấp phép tái sử dụng." Thứ ba, việc loại bỏ trùng lặp hiếm khi hoàn toàn, và các đoạn văn bản có bản quyền đã nhớ vẫn tồn tại sau khi loại bỏ trùng lặp trừ khi bạn kiểm tra theo độ tương đồng, không phải theo hash chính xác.

CÁC BƯỚC THỰC TIỄN ĐỂ GIẢM RỦI RO

  1. Thiết lập một bản khai: yêu cầu nguồn, nhãn giấy phép và bước đưa vào trước khi bất kỳ tệp nào vào đào tạo. 2. Ưu tiên các kiểm tra giấy phép tự động và quét độ tương đồng cho các phân nhóm có rủi ro cao như tin tức gần đây, nội dung có phí và bộ sưu tập nghệ thuật. 3. Ở nơi giấy phép bị thiếu, ưu tiên CC0 hoặc các thay thế được cấp phép rõ ràng, hoặc loại bỏ nội dung.

Đây là những đánh đổi thực tế. Các quét tự động có thể tạo ra các kết quả dương tính giả và cần phải được xem xét bởi con người. Việc loại bỏ dữ liệu mơ hồ làm thu hẹp phạm vi và có thể gây thiên lệch cho các mô hình. Các thương lượng giấy phép với các nhà xuất bản tiêu tốn thời gian và tiền bạc nhưng giảm rủi ro pháp lý, vì vụ kiện Getty Images v. Stability AI và các vụ kiện liên quan đã khiến các đội ngũ phải thận trọng; các công ty và trình theo dõi như Bloomberg Law và chính các hồ sơ của Getty cho thấy bối cảnh pháp lý vẫn chưa ổn định.

TÓM TẮT NHANH

Sử dụng một thẻ tập dữ liệu ngắn cho mỗi tập hợp. Dựa vào W3C PROV cho nguồn gốc có thể đọc bằng máy và các trường DataCite cho các định danh vĩnh viễn. Kiểm toán bằng hash cộng với độ tương đồng, và xem các giấy phép bị thiếu như không đáng tin cậy. Đối với các chiến lược dữ liệu tổng hợp giảm thiểu sự phơi bày, xem ghi chú của chúng tôi về quy trình dẫn xuất tổng hợp và triển khai LLM riêng tư trong các bài viết liên quan: quy trình dữ liệu tổng hợptriển khai LLM riêng tư.

Chúng tôi ước tính rằng việc cấp phép và ghi nhận nguồn gốc có kỷ luật giảm thiểu sự không chắc chắn về pháp lý khoảng một nửa cho hầu hết các đội sản phẩm, vì chúng thay thế những suy đoán bằng các hồ sơ có thể theo dõi; lập luận phản biện là các tòa án vẫn có thể quyết định việc sử dụng trong đào tạo là xâm phạm ngay cả khi có siêu dữ liệu hoàn hảo, vì vậy tài liệu giảm nhưng không loại bỏ rủi ro pháp lý.

Mẫu viral

Khám phá các mẫu AI viral của chúng tôi và áp dụng vào ảnh của bạn.

Khám phá mẫu