bigscience-workshop / bigscience-workshop/data_tooling

Create dataset xnli

Đang mở
#350 0 bình luận 0 reaction 0 người được giao Xem trên GitHub
data catalog
Ngôn ngữ chính
HTML
Star
91
Fork
47
Chỉ số merge pull request
Không có pull request nào được merge trong 30 ngày

Mô tả

- uid: xnli
- type: primary
- description:
- name: XNLI
- description: it is a Cross-lingual Natural Language Inference corpus that
- homepage: https://github.com/facebookresearch/XNLI
- validated: True
- languages:
- language_names:
- English
- French
- Spanish
- Arabic
- Vietnamese
- Chinese
- ar-MSA
- German
- Greek languages
- Bulgarian
- Russian
- Arabic
- Turkish
- Thai
- Hindi
- Swahili (macrolanguage)
- Urdu
- language_comments:
- language_locations:
- validated: False
- custodian:
- name:
- in_catalogue:
- type:
- location:
- contact_name: XNLI
- contact_email:
- contact_submitter: False
- additional:
- validated: False
- availability:
- procurement:
- for_download: Yes - it has a direct download link or links
- download_url: https://dl.fbaipublicfiles.com/XNLI/XNLI-MT-1.0.zip
- download_email:
- licensing:
- has_licenses: Yes
- license_text:
- license_properties:
- open license
- public domain
- license_list:
- pii:
- has_pii: Unclear
- generic_pii_likely:
- generic_pii_list:
- numeric_pii_likely:
- numeric_pii_list:
- sensitive_pii_likely:
- sensitive_pii_list:
- no_pii_justification_class: general knowledge not written by or referring to private persons
- no_pii_justification_text:
- validated: False
- source_category:
- category_type: collection
- category_web:
- category_media:
- validated: False
- media:
- category:
- text
- text_format:
- .CSV
- audiovisual_format:
- image_format:
- database_format:
- .ZIP
- text_is_transcribed: Yes - audiovisual
- instance_type:
- instance_count: 100K

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Hướng nghiên cứu

Bắt đầu bằng cách xác định các mục siêu dữ liệu của những dataset hiện có và so sánh cấu trúc của chúng với bản ghi xnli.json được yêu cầu. Thêm siêu dữ liệu XNLI bằng URL tải xuống, danh sách ngôn ngữ, thông tin cấp phép và các trường media được cung cấp; công việc được hoàn tất khi bản ghi tuân theo schema của repository và được đưa vào cùng với các dataset khác.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Đánh giá

Công nghệ
json
Lĩnh vực
data
Loại issue
Tính năng
Độ khó
2/5
Thời gian dự kiến
1-3 giờ
Mức độ hoạt động
Đình trệ
Độ rõ ràng
Khá rõ ràng
Mức phù hợp với người mới
48/100

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.