bigscience-workshop / bigscience-workshop/data_tooling
Create dataset xnli
- Ngôn ngữ chính
- HTML
- Star
- 91
- Fork
- 47
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Mô tả
- uid: xnli
- type: primary
- description:
- name: XNLI
- description: it is a Cross-lingual Natural Language Inference corpus that
- homepage: https://github.com/facebookresearch/XNLI
- validated: True
- languages:
- language_names:
- English
- French
- Spanish
- Arabic
- Vietnamese
- Chinese
- ar-MSA
- German
- Greek languages
- Bulgarian
- Russian
- Arabic
- Turkish
- Thai
- Hindi
- Swahili (macrolanguage)
- Urdu
- language_comments:
- language_locations:
- validated: False
- custodian:
- name:
- in_catalogue:
- type:
- location:
- contact_name: XNLI
- contact_email:
- contact_submitter: False
- additional:
- validated: False
- availability:
- procurement:
- for_download: Yes - it has a direct download link or links
- download_url: https://dl.fbaipublicfiles.com/XNLI/XNLI-MT-1.0.zip
- download_email:
- licensing:
- has_licenses: Yes
- license_text:
- license_properties:
- open license
- public domain
- license_list:
- pii:
- has_pii: Unclear
- generic_pii_likely:
- generic_pii_list:
- numeric_pii_likely:
- numeric_pii_list:
- sensitive_pii_likely:
- sensitive_pii_list:
- no_pii_justification_class: general knowledge not written by or referring to private persons
- no_pii_justification_text:
- validated: False
- source_category:
- category_type: collection
- category_web:
- category_media:
- validated: False
- media:
- category:
- text
- text_format:
- .CSV
- audiovisual_format:
- image_format:
- database_format:
- .ZIP
- text_is_transcribed: Yes - audiovisual
- instance_type:
- instance_count: 100K
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Bắt đầu bằng cách xác định các mục siêu dữ liệu của những dataset hiện có và so sánh cấu trúc của chúng với bản ghi xnli.json được yêu cầu. Thêm siêu dữ liệu XNLI bằng URL tải xuống, danh sách ngôn ngữ, thông tin cấp phép và các trường media được cung cấp; công việc được hoàn tất khi bản ghi tuân theo schema của repository và được đưa vào cùng với các dataset khác.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- json
- Lĩnh vực
- data
- Loại issue
- Tính năng
- Độ khó
- 2/5
- Thời gian dự kiến
- 1-3 giờ
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Khá rõ ràng
- Mức phù hợp với người mới
- 48/100