Other corpora/nl: Difference between revisions

From Clarin K-Centre
Jump to navigation Jump to search
(Created page with "Het NAMES Corpus bevat een verzameling van 189.707 voornamen (61,9 miljoen tokens) en 562.676 achternamen (54,6 miljoen tokens) zoals gevonden in 19de-eeuwse geboorte-, huwelijks- en overlijdensakten (toegankelijk via wiewaswie.nl in de versie van 2011). Het is een resultaat van het CLARIAH-project 'NAMES' dat als doel had naamstandaarden te ontwikkelen voor het beheersen van variaties in persoonsnamen. De clustering van namen onder een standaard is gebaseerd op bestaand...")
(Created page with "==MQA (Multilingual corpus of Questions and Answers)== Geparseerd van de [https://commoncrawl.org/ Common Crawl]. Het corpus bestaat uit 234 miljoen paren van vragen en antwoorden in 39 verschillende talen.")
Line 92: Line 92:
*[https://aclanthology.org/2021.mrqa-1.1 Paper]
*[https://aclanthology.org/2021.mrqa-1.1 Paper]


<div lang="en" dir="ltr" class="mw-content-ltr">
==VaccinChatNL==
==VaccinChatNL==
A Belgian Dutch FAQ dataset on the topic of COVID-19 vaccinations in Flanders. It consists of 12,833 user questions divided over 181 answer labels, thus providing large groups of semantically equivalent paraphrases (a many-to-one mapping of user questions to answer labels). VaccinChatNL is the first Dutch many-to-one FAQ dataset of this size.
Een Belgisch-Nederlandse FAQ-dataset op het gebied van COVID-19-vaccinaties in Vlaanderen. Het bestaat uit 12.833 gebruikersvragen, verdeeld over 181 antwoord-labels, waarmee het grote groepen semantisch gelijkwaardige parafrases aanbiedt. VaccinChatNL is de eerste Nederlandse Dutch FAQ dataset van deze grootte.
*[https://www.uantwerpen.be/en/research-groups/clips/research/datasets/ Webpage]
*[https://www.uantwerpen.be/en/research-groups/clips/research/datasets/ Webpagina]
*[https://aclanthology.org/2022.coling-1.312 Paper]
*[https://aclanthology.org/2022.coling-1.312 Paper]
</div>


<div lang="en" dir="ltr" class="mw-content-ltr">
==MQA (Multilingual corpus of Questions and Answers)==
==MQA (Multilingual corpus of Questions and Answers)==
Parsed from the [https://commoncrawl.org/ Common Crawl]. The corpus contains 234 million pairs of questions and answers in 39 languages.
Geparseerd van de [https://commoncrawl.org/ Common Crawl]. Het corpus bestaat uit 234 miljoen paren van vragen en antwoorden in 39 verschillende talen.
</div>


<div lang="en" dir="ltr" class="mw-content-ltr">
*[https://huggingface.co/datasets/clips/mqa Webpagina]
*[https://huggingface.co/datasets/clips/mqa Webpage]
*[https://aclanthology.org/2021.mrqa-1.1 Paper]
*[https://aclanthology.org/2021.mrqa-1.1 Paper]
</div>


<div lang="en" dir="ltr" class="mw-content-ltr">
<div lang="en" dir="ltr" class="mw-content-ltr">

Revision as of 13:17, 21 March 2024

BasiLex-corpus

Het BasiLex-corpus is een geannoteerde verzameling van teksten geschreven voor kinderen in de basisschoolleeftijd. Het corpus bevat 13,5 miljoen tokens, waarvan 11,5 miljoen woorden. De tokens komen voor ongeveer 40% uit educatieve materialen, 40% uit kinderliteratuur en 20% uit media.

BasiScript-corpus

BasiScript is een corpus met 9 miljoen woorden geschreven tekst geproduceerd door leerlingen van de Nederlandse basisschool.

CLiPS Stylometry Investigation (CSI) Corpus

Het CSI-corpus is een jaarlijks uitgebreid corpus van studententeksten in twee genres: essays en reviews. Het doel van dit corpus bevindt zich met name in onderzoek naar stylometrie, maar andere toepassingen zijn ook mogelijk. Er is een uitgebreide hoeveelheid metadata beschikbaar, zowel over de auteur (gender, leeftijd, seksuele oriëntatie, regio van oorsprong, persoonlijkheidsprofiel), als ook over het document (tijdsvermelding, genre, echtheid, sentiment, cijfer). De huidige versie van het corpus is samengesteld in februari 2016. Eerdere versies van het corpus zijn verkrijgbaar bij de auteurs via emailaanvraag.

CONDIV-corpus

Het CONDIV-corpus is een elektronisch toegankelijke, regionaal, stilistisch en diachroon gecontroleerde materiaalverzameling van ongeveer 47.000.000 woorden geschreven Nederlands, die speciaal ten behoeve van het CONDIV-project ontwikkeld werd. Om toegang te krijgen tot de data, dient u contact op te nemen met Dirk Speelman van de KU Leuven

COREA-coreferentiecorpus

Het COREA-coreferentiecorpus (circa 150.000 woorden) bestaat uit Nederlandse teksten waarin coreferentierelaties systematisch gemarkeerd zijn. De teksten bestaan uit krantenartikelen (D-Coi), getranscribeerde spraak (CGN) en lemma's uit de Spectrum (Winkler Prins) Medische Encyclopedie.

D-Tuna-corpus

Het D-TUNA-corpus bestaat uit 2400 geschreven en (getranscribeerde) gesproken referentiële expressies. De semantische annotatie van alle expressies (xml-formaat) maakt het corpus bruikbaar als input voor taalgeneratiesystemen. De samenstelling van het D-TUNA-corpus is geïnspireerd op het Engelse TUNA Corpus.

DBRD

De DBRD (uitgesproken als 'dee-bird') dataset bevat meer dan 110.000 boekreviews, waarvan 22.000 met bijbehorende binaire sentiment polariteitslabels. Het is bedoeld als een benchmark voor sentimentclassificatie in het Nederlands. De dataset kan worden gebruikt om een model te trainen voor sequentiemodellering, in het specifiek taalmodellering. Daarnaast kan het worden gebruikt om een model te trainen voor tekstclassificatie, in het specifiek sentimentclassificatie, met gebruik van de aangeboden positieve/negatieve sentiment polariteitslabels.

Dutch Audio Description Corpus

Het Dutch Audio Description-corpus bevat de getranscribeerde teksten van 39 audio-beschreven Nederlandse films en tv-series. In totaal bevat het corpus 154.570 woorden en 3.074 minuten aan video. Dit Dutch AD corpus is gebruikt om een reeks kwantitatieve data betreffende de taal van AD te extraheren, nl. frequentietellingen van delen van spraak, woorden, lemma, collocaties en de berekening van andere relevante tekststatistieken zoals leessnelheid, woord-en zinlengte, leesbaarheid en type token ratio (een statistische meting die de lexicale verscheidenheid weergeeft).

deLearyous

De deLearyous dataset is een Nederlands (Vlaamse) dataset voor emotieclassificatie volgens het framework van Leary's Rose, beter bekend als het Interpersonal Circumplex. De dataset bestaat uit 11 gesprekken die zijn geannoteerd op zinsniveau met hun positie op Leary's Rose, in functie van de twee kenmerkende dimensies: 'dominantie', en 'affiniteit'.

Dutch Idiom Database: Native Speakers (DID-NS)

Een database met beoordelingen van 390 moedertaalsprekers van 374 Nederlandse uitdrukkingen. In een online onderzoek hebben de deelnemers de idiomatsche uitdrukkingen beoordeeld op een aantal aspecten: frequentie, gebruik, bekendheid, voorstelbaarheid en transparantie. Ook is onderzocht of ze de juiste betekenis van de uitdrukkingen kenden.

NAMES Corpus

Het NAMES Corpus bevat een verzameling van 189.707 voornamen (61,9 miljoen tokens) en 562.676 achternamen (54,6 miljoen tokens) zoals gevonden in 19de-eeuwse geboorte-, huwelijks- en overlijdensakten (toegankelijk via wiewaswie.nl in de versie van 2011). Het is een resultaat van het CLARIAH-project 'NAMES' dat als doel had naamstandaarden te ontwikkelen voor het beheersen van variaties in persoonsnamen. De clustering van namen onder een standaard is gebaseerd op bestaande kennis van varianten en op spellingsovereenkomst. Er is gebruikgemaakt van zowel automatische als handmatige gegevensverwerking. Praktische bruikbaarheid van een standaard (met verschillende kwaliteitsniveaus) had de voorkeur boven een etymologisch verantwoorde afleiding die vaak niet te maken is.

Personae Corpus

Het Personae-corpus is verzameld voor experimenten in 'Authorship Attribution and Personality Prediction'. Het bestaat uit 145 Nederlandstalige essays, geschreven door 145 verschillende studenten (BA in taalkunde en literatuur aan de Universiteit van Antwerpen, België). Elke student deed ook een online MBTI-persoonlijkheidstest, wat persoonlijkheidsvoorspellingsexperimenten mogelijk maakt. Het corpus is gecontroleerd op onderwerp, register, genre, leeftijd, en opleidingsniveau. De originele teksten, een syntactisch geannoteerde versie van de teksten en de metadata zijn beschikbaar.

JASMIN-BLISS-Negation

Een corpusvoorbeeld van Nederlandse mens-machinedialogen, geannoteerde met ontkenningssignalen.

Multimodal ABEA

Multimodale dataset die kan worden gebruikt binnen de context van aspect-based sentiment-en emotieherkenning. Het bestaat uit 4.900 opmerkingen op 175 afbeeldingen op de Adidas Instagram-pagina en is geannoteerd met zowel aspect als emotielabels.

MFAQ (Multilingual corpus of Frequently Asked Questions)

Geparseerd van de Common Crawl. Het corpus bevat zes miljoen paren van vragen en antwoorden in 21 verschillende talen.

VaccinChatNL

Een Belgisch-Nederlandse FAQ-dataset op het gebied van COVID-19-vaccinaties in Vlaanderen. Het bestaat uit 12.833 gebruikersvragen, verdeeld over 181 antwoord-labels, waarmee het grote groepen semantisch gelijkwaardige parafrases aanbiedt. VaccinChatNL is de eerste Nederlandse Dutch FAQ dataset van deze grootte.

MQA (Multilingual corpus of Questions and Answers)

Geparseerd van de Common Crawl. Het corpus bestaat uit 234 miljoen paren van vragen en antwoorden in 39 verschillende talen.

Dutch Audio Description Corpus

The Dutch Audio Description corpus includes the transcribed texts of 39 audio described Dutch films and TV series, in total 154,570 words and 3,074 minutes of video. The data include the corpus files (XML-files) of the transcribed audio descriptions, the multimodal concordancer developed for the project and the raw data extracted from the corpus as part of the PHD project during which this corpus was developed.

Named Entity Recognition CoNLL2002

Spanish and Dutch data with named entity labels. The Dutch data consist of four editions of the Belgian newspaper "De Morgen" of 2000 (June 2, July 1, August 1 and September 1). For the Dutch data, the annotator has followed the MITRE and SAIC guidelines for named entity recognition (Chinchor et al., 1999) as well as possible.

CC-100 Corpus

This corpus is an attempt to recreate the dataset used for training XLM-R. This corpus comprises of monolingual data for 100+ languages and also includes data for romanized languages (indicated by *_rom). This was constructed using the urls and paragraph indices provided by the CC-Net repository by processing January-December 2018 Commoncrawl snapshots. Each file comprises of documents separated by double-newlines and paragraphs within the same document separated by a newline. The data is generated using the open source CC-Net repository. No claims of intellectual property are made on the work of preparation of the corpus. Dutch is one of the languages.

Dutch Gigacorpus

With 234GB of varied plain text, and no fewer than 40 billion tokens, this is in any case one of the largest Dutch corpora. This corpus is also freely available and the quality is relatively high for its size, care has been taken to ensure that the data is as clean as possible. Also, the corpus contains 400 million forum posts in 10 million threads with their timestamp intact for linguistic research.