huggingface / huggingface/datatrove

DocumentTokenizer with document.metadata

Open
#358 1 comment 0 reactions 0 assignees View on GitHub
Dominant language
Python
Stars
3.3k
Forks
302
Avg merge
2h 18m
Merged PRs (30d)
2

Description

I am using nanosets for training nanotron.
https://github.com/huggingface/nanotron/blob/main/docs/nanoset.md

I am using wikipedia training data
https://huggingface.co/datasets/wikimedia/wikipedia

From the wikipedia I want to use the two additional columns title and url as metadata during training.

The BaseReader._default_adapter is loading the two columns: title and url into document.metadata
```
return
{
"text": data.pop(self.text_key, ""),
"id": data.pop(self.id_key, f"{path}/{id_in_file}"),
"media": data.pop("media", []),
"metadata": data.pop("metadata", {}) | data, # remaining data goes into metadata
}
```

But DocumentTokenizer is not using this metadata while generating code
```
DocumentTokenizer class:
encoded_batch: list[Encoding] = self.tokenizer.encode_batch([document.text for document in batch])
```

How to setup DocumentTokenizer to use the document.metadata during tokenization

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.