Simplification Data/nl: Difference between revisions
(Created page with "Simplificatiedata") |
(Created page with "Het ASSET simplificatiecorpus (Alva-Manchego et al, 2020) is automatisch vertaald naar het Nederlands (Seidl et al., 2023), en is vrij beschikbaar.") |
||
Line 6: | Line 6: | ||
===ASSET Simplificatiecorpus=== | ===ASSET Simplificatiecorpus=== | ||
Het ASSET simplificatiecorpus (Alva-Manchego et al, 2020) is automatisch vertaald naar het Nederlands (Seidl et al., 2023), en is vrij beschikbaar. | |||
*[https://github.com/tsei902/simplify_dutch/tree/main/resources/datasets/asset Github download] | *[https://github.com/tsei902/simplify_dutch/tree/main/resources/datasets/asset Github download] | ||
* <small>Alva-Manchego, F., Martin, L., Bordes, A., Scarton, C., Sagot, B., & Specia, L. (2020). ASSET: A dataset for tuning and evaluation of sentence simplification models with multiple rewriting transformations. arXiv preprint arXiv:2005.00481.</small> | * <small>Alva-Manchego, F., Martin, L., Bordes, A., Scarton, C., Sagot, B., & Specia, L. (2020). ASSET: A dataset for tuning and evaluation of sentence simplification models with multiple rewriting transformations. arXiv preprint arXiv:2005.00481.</small> | ||
* <small>Seidl, T., Vandeghinste, V., & Van de Cruys, T. (2023). [https://kuleuven.limo.libis.be/discovery/fulldisplay?docid=alma9993527112601488&context=L&vid=32KUL_KUL:KULeuven&lang=en&search_scope=All_Content&adaptor=Local%20Search%20Engine&tab=all_content_tab&query=any,contains,seidl%20theresa&offset=0 Controllable Sentence Simplification in Dutch]. KU Leuven. Faculteit Ingenieurswetenschappen.</small> | * <small>Seidl, T., Vandeghinste, V., & Van de Cruys, T. (2023). [https://kuleuven.limo.libis.be/discovery/fulldisplay?docid=alma9993527112601488&context=L&vid=32KUL_KUL:KULeuven&lang=en&search_scope=All_Content&adaptor=Local%20Search%20Engine&tab=all_content_tab&query=any,contains,seidl%20theresa&offset=0 Controllable Sentence Simplification in Dutch]. KU Leuven. Faculteit Ingenieurswetenschappen.</small> | ||
===Wikilarge Dataset=== | ===Wikilarge Dataset=== | ||
Automatische vertaling van de Wikilarge dataset, nuttig voor automatische vereenvoudiging (Seidl et al., 2023). Vrij beschikbaar. Originele dataset van Zhang & Lapata | |||
*[https://github.com/tsei902/simplify_dutch/tree/main/resources/datasets/wikilarge Github download] | *[https://github.com/tsei902/simplify_dutch/tree/main/resources/datasets/wikilarge Github download] | ||
* <small>Seidl, T., Vandeghinste, V., & Van de Cruys, T. (2023). [https://kuleuven.limo.libis.be/discovery/fulldisplay?docid=alma9993527112601488&context=L&vid=32KUL_KUL:KULeuven&lang=en&search_scope=All_Content&adaptor=Local%20Search%20Engine&tab=all_content_tab&query=any,contains,seidl%20theresa&offset=0 Controllable Sentence Simplification in Dutch]. KU Leuven. Faculteit Ingenieurswetenschappen.</small> | * <small>Seidl, T., Vandeghinste, V., & Van de Cruys, T. (2023). [https://kuleuven.limo.libis.be/discovery/fulldisplay?docid=alma9993527112601488&context=L&vid=32KUL_KUL:KULeuven&lang=en&search_scope=All_Content&adaptor=Local%20Search%20Engine&tab=all_content_tab&query=any,contains,seidl%20theresa&offset=0 Controllable Sentence Simplification in Dutch]. KU Leuven. Faculteit Ingenieurswetenschappen.</small> | ||
* <small>Zhang, X. & Lapata, M. (2017). Sentence Simplification with Deep Reinforcement Learning. In ''Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing'', pages 584–594, Copenhagen, Denmark. Association for Computational Linguistics.</small> | * <small>Zhang, X. & Lapata, M. (2017). Sentence Simplification with Deep Reinforcement Learning. In ''Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing'', pages 584–594, Copenhagen, Denmark. Association for Computational Linguistics.</small> | ||
===NFI SimpleWiki dataset=== | ===NFI SimpleWiki dataset=== | ||
Vertaalde dataset gecreëerd door het Nederlands Forensisch Instituut met Meta's [https://ai.meta.com/research/no-language-left-behind/ No Language Left Behind model]. Het bevat 167000 gealigneerde zinsparen en doet dienst als de Nederlandse vertaling van de SimpleWiki [https://cs.pomona.edu/~dkauchak/simplification/ dataset]. | |||
* 8.67 MB | * 8.67 MB | ||
* [https://huggingface.co/datasets/NetherlandsForensicInstitute/simplewiki-translated-nl Download dataset] | * [https://huggingface.co/datasets/NetherlandsForensicInstitute/simplewiki-translated-nl Download dataset] | ||
< | <span id="Comparable_Corpus_Wablieft_De_Standaard"></span> | ||
== | ==Vergelijkbaar Corpus Wablieft De Standaard== | ||
Corpus gecreëerd door Nick Vanackere. Het bevat 12.687 Wablieft-artikelen uit de periode 2012-2017 en 206.466 De Standaard-artikelen uit de periode 2013-2017. Om de vergelijkbaarheid te garanderen, werden alleen artikels van 08/01/2013 tot 16/11/2017 bekeken, wat resulteerde in 8.744 Wablieft-artikels en 202.284 De Standaard-artikels. Het verschil in het aantal artikelen is te wijten aan de verschijningsfrequentie: Wablieft verschijnt wekelijks en De Standaard dagelijks. | |||
Corpus | |||
*[https://github.com/nivack/comparable_corpus_Wablieft_deStandaard Github] | *[https://github.com/nivack/comparable_corpus_Wablieft_deStandaard Github] | ||
*[https://kuleuven.limo.libis.be/discovery/fulldisplay?docid=alma9993153812401488&context=L&vid=32KUL_KUL:KULeuven&lang=en&search_scope=All_Content&adaptor=Local%20Search%20Engine&tab=all_content_tab&query=any,contains,nick%20vanackere&offset=0 Vanackere, N., & Vandeghinste, V. (2022). Building a comparable corpus between easy-to-read Dutch Wablieft and De Standaard. KU Leuven. Faculteit Ingenieurswetenschappen.] | *[https://kuleuven.limo.libis.be/discovery/fulldisplay?docid=alma9993153812401488&context=L&vid=32KUL_KUL:KULeuven&lang=en&search_scope=All_Content&adaptor=Local%20Search%20Engine&tab=all_content_tab&query=any,contains,nick%20vanackere&offset=0 Vanackere, N., & Vandeghinste, V. (2022). Building a comparable corpus between easy-to-read Dutch Wablieft and De Standaard. KU Leuven. Faculteit Ingenieurswetenschappen.] | ||
< | <span id="Synthetic_datasets"></span> | ||
== | ==Synthetische datasets== | ||
===UWV Leesplank NL wikipedia=== | ===UWV Leesplank NL wikipedia=== | ||
Data bevat 2,391,206 pragrafen van prompt/resultaat-combinatiess, waar het prompt een paragraaf uit de Nederlandse Wikipedia is en het resultaat een vereenvoudigde tekst is, die een of meer paragrafen kan bevatten. Deze dataset werd gecreëerd door UWV, als onderdeel van project "Leesplank", een inspanning om datasets te genereren die ethisch en wettelijk in orde zijn. | |||
* [https://huggingface.co/datasets/UWV/Leesplank_NL_wikipedia_simplifications/blob/main/README.md HuggingFace ReadMe file] | * [https://huggingface.co/datasets/UWV/Leesplank_NL_wikipedia_simplifications/blob/main/README.md HuggingFace ReadMe file] | ||
* [https://huggingface.co/datasets/UWV/Leesplank_NL_wikipedia_simplifications Downloadpagina] | |||
*[https://huggingface.co/datasets/UWV/Leesplank_NL_wikipedia_simplifications | |||
Een uitgebreidere versie van deze dataset werd gemaakt door Michiel Buisman en Bram Vanroy. Deze dataset bevat een eerste, kleine set variaties van Wikipediaparagrafen in verschillende stijlen (jargon, officieel, archaïsche taal, technisch, academisch en poëtisch). | |||
* 3.02 MB | * 3.02 MB | ||
* [https://huggingface.co/datasets/UWV/veringewikkelderingen | * [https://huggingface.co/datasets/UWV/veringewikkelderingen Downloadpagina] | ||
<div lang="en" dir="ltr" class="mw-content-ltr"> | <div lang="en" dir="ltr" class="mw-content-ltr"> |
Revision as of 11:33, 2 July 2024
Automatisch vertaalde datasets
ASSET Simplificatiecorpus
Het ASSET simplificatiecorpus (Alva-Manchego et al, 2020) is automatisch vertaald naar het Nederlands (Seidl et al., 2023), en is vrij beschikbaar.
- Github download
- Alva-Manchego, F., Martin, L., Bordes, A., Scarton, C., Sagot, B., & Specia, L. (2020). ASSET: A dataset for tuning and evaluation of sentence simplification models with multiple rewriting transformations. arXiv preprint arXiv:2005.00481.
- Seidl, T., Vandeghinste, V., & Van de Cruys, T. (2023). Controllable Sentence Simplification in Dutch. KU Leuven. Faculteit Ingenieurswetenschappen.
Wikilarge Dataset
Automatische vertaling van de Wikilarge dataset, nuttig voor automatische vereenvoudiging (Seidl et al., 2023). Vrij beschikbaar. Originele dataset van Zhang & Lapata
- Github download
- Seidl, T., Vandeghinste, V., & Van de Cruys, T. (2023). Controllable Sentence Simplification in Dutch. KU Leuven. Faculteit Ingenieurswetenschappen.
- Zhang, X. & Lapata, M. (2017). Sentence Simplification with Deep Reinforcement Learning. In Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, pages 584–594, Copenhagen, Denmark. Association for Computational Linguistics.
NFI SimpleWiki dataset
Vertaalde dataset gecreëerd door het Nederlands Forensisch Instituut met Meta's No Language Left Behind model. Het bevat 167000 gealigneerde zinsparen en doet dienst als de Nederlandse vertaling van de SimpleWiki dataset.
- 8.67 MB
- Download dataset
Vergelijkbaar Corpus Wablieft De Standaard
Corpus gecreëerd door Nick Vanackere. Het bevat 12.687 Wablieft-artikelen uit de periode 2012-2017 en 206.466 De Standaard-artikelen uit de periode 2013-2017. Om de vergelijkbaarheid te garanderen, werden alleen artikels van 08/01/2013 tot 16/11/2017 bekeken, wat resulteerde in 8.744 Wablieft-artikels en 202.284 De Standaard-artikels. Het verschil in het aantal artikelen is te wijten aan de verschijningsfrequentie: Wablieft verschijnt wekelijks en De Standaard dagelijks.
- Github
- Vanackere, N., & Vandeghinste, V. (2022). Building a comparable corpus between easy-to-read Dutch Wablieft and De Standaard. KU Leuven. Faculteit Ingenieurswetenschappen.
Synthetische datasets
UWV Leesplank NL wikipedia
Data bevat 2,391,206 pragrafen van prompt/resultaat-combinatiess, waar het prompt een paragraaf uit de Nederlandse Wikipedia is en het resultaat een vereenvoudigde tekst is, die een of meer paragrafen kan bevatten. Deze dataset werd gecreëerd door UWV, als onderdeel van project "Leesplank", een inspanning om datasets te genereren die ethisch en wettelijk in orde zijn.
Een uitgebreidere versie van deze dataset werd gemaakt door Michiel Buisman en Bram Vanroy. Deze dataset bevat een eerste, kleine set variaties van Wikipediaparagrafen in verschillende stijlen (jargon, officieel, archaïsche taal, technisch, academisch en poëtisch).
- 3.02 MB
- Downloadpagina
ChatGPT generated dataset by Van de Velde
Created in light of a master thesis by Charlotte Van de Velde. The dataset contains Dutch source sentences and aligned simplified sentences, generated with ChatGPT. All splits combined, the dataset consists of 1267 entries.
- Training = 1013 sentences (262 KB)
- Validation = 126 sentences (32.6 KB)
- Test = 128 sentences (33 KB)
Manually simplified
Dutch municipal data
The Dutch municipal corpus is a parallel monolingual corpus for the evaluation of sentence-level simplification in the Dutch municipal domain. The corpus was created by Amsterdam Intelligence. It contains 1,311 translated parallel sentence pairs that were automatically aligned. The sentence pairs originate from 50 documents from the Communications Department of the City of Amsterdam that were manually simplified to evaluate simplification for Dutch.
- 265 KB
- Github