Kranten corpora

From Clarin K-Centre
Revision as of 10:05, 13 March 2024 by Floyd (talk | contribs) (Created page with "==SumNL: samenvattingencorpus== Het SumNL-samenvattingencorpus is gebaseerd op 30 clusters. Ieder cluster bestaat uit een onderwerp en 5-25 krantenartikelen die relevant zijn voor het onderwerp. Voor ieder cluster werden twee samenvattingen gemaakt van verschillende grootte en ook extracts bestaande uit tien zinnen uit de teksten.")
Jump to navigation Jump to search

SoNaR corpus

Het SoNaR Corpus heeft een krantencomponent (WR-P-P-G) dat bestaat uit bijna 15 miljoen zinnen. Zie ook Referentie corpora.

SumNL: samenvattingencorpus

Het SumNL-samenvattingencorpus is gebaseerd op 30 clusters. Ieder cluster bestaat uit een onderwerp en 5-25 krantenartikelen die relevant zijn voor het onderwerp. Voor ieder cluster werden twee samenvattingen gemaakt van verschillende grootte en ook extracts bestaande uit tien zinnen uit de teksten.

Wablieft corpus: eenvoudige taal

Het Wablieft-corpus bevat het digitaal archief van de Wablieft-krant (periode 2011-2017), zoals ook beschikbaar op de website http://www.wablieft.be/krant/archief.

It contains 2 million words of newspaper material in easy to read Dutch. Metadata is available regarding the newspaper section (interior, sport, ...) and the publication date. This concerns all material since the newspaper became fully available digitally and online, from 2011 to December 2017.

The data is available in different formats: original text files, text files with one sentence per line, annotated with Frog (POS tagging, lemmatisation, morphology, named entity recognition, chunking, dependency relationships) in FoLiA or CoNNL, and analyzed syntactically with Alpino, in Alpino-XML.

There is an agreement with Wablieft for the distribution of this material for non-commercial purposes. Commercial parties can contact Wablieft to obtain a license for the material.

WAI-NOT Corpus

The WAI-NOT Corpus contains the digital archive of the WAI-NOT newspaper (period 2009-2021). The newspaper articles are written in easy to read Dutch.

  • 2009-2021 archive of easy language newspaper in Belgian Dutch
  • version 1.0
  • Download page

Corpus VU-DNC (VU University Diachronic News text Corpus)

The VU-DNC Corpus is a diachronic Dutch newspaper corpus (VU Free University Dutch Newspaper Corpus).

The corpus consists of data from five newspapers: Algemeen Dagblad, NRC (Handelsblad), De Telegraaf, Trouw and De Volkskrant. For each of the newspapers, data of two years (1950/1951 and 2002) are available. The articles were selected by topic (e.g. headline news, foreign news and sports). Special feature of the corpus is that both the presence of subjective elements in the articles and the presence of direct speech have been annotated. The subjective elements are annotated based on a set of lexical elements (subjectivity lexicon). As a result, the corpus is very useful to linguistically oriented researchers who are interested in diachrony and/or subjectivity and to communication scientists and media scholars who are interested in changing practices regarding the framing of coverage.