bigscience-workshop / bigscience-workshop/data_tooling
Reason for not applying remove_non_prining_characters normalization
- Ngôn ngữ chính
- HTML
- Star
- 91
- Fork
- 47
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Mô tả
Hi,
We are much inspired by this great work and are in the process of cleaning our data. However, if we understand correctly, the `remove_non_prining_characters` normalization step is not used for the final cleaning. Do you have any thoughts on why this should not be used?
https://github.com/bigscience-workshop/data_tooling/blob/e28064ec7fb38af5143cafc896e9423a8b12392d/ac_dc/normalization.py#L5
There you have this:
```
non_printing_characters_re = re.compile(
f"[{''.join(map(chr, list(range(0,32)) + list(range(127,160))))}]"
)
```
Which we modified, to keep newlines (`\n`) and tabs (`\t`), and to also remove soft-hyphens, non-breaking spaces, and zero-width space:
```
additional_chars_to_remove = [160, 173, 8203]
non_printing_characters_re = re.compile(
f"[{''.join(map(chr, list(range(0,9)) + list(range(11, 32)) + list(range(127,160)) + additional_chars_to_remove))}]"
)
```
There could of course be more characters that one may want to remove.
To be clear, I am writing this here for two reasons:
1. To get your feedback. Do you think this is a good idea to use for the final data cleaning?
2. If so, this could be incorporated into this repository to help other people that might be thinking about this.
Thanks for your amazing contributions!
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Đọc ac_dc/normalization.py tại regex được đề cập dành cho các ký tự không in được, sau đó theo dõi đường dẫn làm sạch cuối cùng để xác nhận liệu quá trình chuẩn hóa này có được áp dụng hay không. So sánh các phạm vi ký tự được đề xuất cùng các ký tự xuống dòng và tab được giữ lại với hành vi hiện tại của repository. Công việc được xem là hoàn tất khi đạt được quyết định có sự ủng hộ của maintainer và, nếu được chấp nhận, đã tích hợp hướng dẫn này cho việc làm sạch dữ liệu trong tương lai.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- python
- Lĩnh vực
- data
- Loại issue
- Tính năng
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Cần làm rõ
- Mức phù hợp với người mới
- 25/100