HomeDatasetsccdv/arxiv-summarization
A

ccdv/arxiv-summarization

Summarization · ccdv· 9.3K
Unknown 477 MB

Arxiv dataset for summarization Dataset for summarization of long documents.Adapted from this repo.Note that original data are pre-tokenized so this dataset returns " ".join(text) and add "\n" for paragraphs. This dataset is compatible with the run_summarization.py script from Transformers if you add this line to the summarization_name_mapping variable: "ccdv/arxiv-summarization": ("article", "abstract") Data Fields id: paper id article: a string containing the body of… See the full description on the dataset page: https://huggingface.co/datasets/ccdv/arxiv-summarization.

Open in MLForge Sign up free Desktop app
# download instantly
mlforge datasets pull ccdv/arxiv-summarization

Dataset details

Task
Summarization
Language
en
License
Unknown
Size
477 MB
Creator
ccdv
Downloads
9.3K
Source
huggingface_datasets
Updated
2024-08-08

About ccdv/arxiv-summarization

Dataset for summarization of long documents.\ Adapted from this repo.\ Note that original data are pre-tokenized so this dataset returns " ".join(text) and add "\n" for paragraphs. \ This dataset is compatible with the runsummarization.py script from Transformers if you add this line to the summarizationnamemapping variable: