huggingface / huggingface/datatrove
DocumentTokenizer with document.metadata
- Dominant language
- Python
- Stars
- 3.3k
- Forks
- 302
- Avg merge
- 2h 18m
- Merged PRs (30d)
- 2
Description
I am using nanosets for training nanotron.
https://github.com/huggingface/nanotron/blob/main/docs/nanoset.md
I am using wikipedia training data
https://huggingface.co/datasets/wikimedia/wikipedia
From the wikipedia I want to use the two additional columns title and url as metadata during training.
The BaseReader._default_adapter is loading the two columns: title and url into document.metadata
```
return
{
"text": data.pop(self.text_key, ""),
"id": data.pop(self.id_key, f"{path}/{id_in_file}"),
"media": data.pop("media", []),
"metadata": data.pop("metadata", {}) | data, # remaining data goes into metadata
}
```
But DocumentTokenizer is not using this metadata while generating code
```
DocumentTokenizer class:
encoded_batch: list[Encoding] = self.tokenizer.encode_batch([document.text for document in batch])
```
How to setup DocumentTokenizer to use the document.metadata during tokenization
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.