Gesproken corpora

From Clarin K-Centre
Revision as of 09:56, 21 March 2024 by Floyd (talk | contribs)
Jump to navigation Jump to search

Gesproken corpora zijn corpora die bestaan uit gesproken data of materiaal dat gebaseerd is op gesproken data.

Boarnsterhim Corpus (BHC) (Momenteel niet beschikbaar)

Het Boarnsterhim Corpus bestaat uit 250 uur spraak in zowel West-Fries als Nederlands door dezelfde groep tweetalige sprekers. Het corpus bevat originele opnamen uit 1982-1984 en een replicerend onderzoek 35 jaar later. De dataverzameling omvat de spraak van vier generaties en combineert paneldata en trenddata. ##Dit corpus is tijdelijk niet beschikbaar omdat er aanpassingen noodzakelijk zijn. Voor meer informatie hierover kunt u contact opnemen met Hans van de Velde (HvandeVelde@fryske-akademy.nl) of met Wilbert Heeringa, de datamanager van de FA (wheeringa@fryske-akademy.nl).##

  • 42.6 MB
  • versie 1.0 (2020)
  • dataset van 1982-1984 + replicatie 35 jaar later
  • Download pagina

COPAS: Corpus Pathologische en Normale Spraak

Het Corpus Pathologische en Normale Spraak (COPAS) bevat opnames van de DIA (Dutch Intelligibility Assessment). Daarnaast bevat het ook voorgelezen tekstpassages, afzonderlijke zinnen en spontane spraak van een deel van de sprekers. Het corpus bevat opnames van bijna 200 Vlaamse pathologische sprekers (= sprekers met een hoorbare stoornis) en 122 Vlaamse controlesprekers. De nodige annotaties werden voorzien.

Corpus Gesproken Nederlands

Het Corpus Gesproken Nederlands (CGN) is een verzameling van 900 uur (bijna 9 miljoen woorden) hedendaagse Nederlandse spraak, afkomstig van Vlamingen en Nederlanders.

De spraakfragmenten (spontaan en voorbereid) zijn opgelijnd met diverse transcripties (o.a. orthografisch, fonetisch) en annotaties (syntactisch, POS-tags). Metadata, lexica, frequentielijsten en de corpusexploratiesoftware Corex behoren ook tot het CGN.

IFA Spoken Language Corpus

Het IFA Spoken Language Corpus is een gratis (GPL) database van handmatig gesegmenteerde gesproken Nederlands op foneem niveau. Het is samengesteld met pasklare software en gesproken Nederlands afkomstig van 8 sprekers met een verscheidenheid aan spreekstijlen. Voor een totaal van 50.000 woorden (41 minuten/spreker), duurde het vergaren en voorbereiden van spraak ongeveer drie weken per spreker.

JASMIN-spraakcorpus

Het JASMIN-spraakcorpus is een verzameling Nederlandse spraak van jongeren, anderstaligen en senioren, woonachtig in Vlaanderen en Nederland. De spraakopnames bestaan uit voorgelezen teksten en mens-machinedialogen, en zijn verrijkt met verschillende annotatielagen. Het JASMIN-spraakcorpus is een aanvulling op het Corpus Gesproken Nederlands (CGN).

SABeD -- Spoken Academic Belgian Dutch

The SABeD corpus collection project has started on the 1st of March 2021 and is not yet available. The corpus of spoken academic Belgian Dutch will consist of at least 200 lectures.

AUTONOMATA-namencorpus

The AUTONOMATA Spoken Names Corpus is a database with in total about 5000 read first names, surnames, straat names, city names and check words.

AUTONOMATA-POI-corpus

The AUTONOMATA POI Corpus is a corpus of 800 pronounced points of interest from the Netherlands and Belgium containing names of restaurants, camping sites, cafés, etc.

Children's Oral Reading Corpus (CHOREC)

The CHOREC Corpus contains recorded, transcribed and annotated read speech (42 GB or 130 hours) of 400 Dutch speaking elementary school children with or without reading difficulties. Analyses of inter- and intra-annotator agreement are carried out in order to investigate the consistency with which reading errors are detected, orthographic and phonetic transcriptions are made, and reading errors and reading strategies are labeled.

BLISS Dialogue Summaries

This dataset consists of Dutch recordings of participants talking with the BLISS dialogue system about their everyday occupations and their favorite activities. The corpus contains 55 recordings with an average duration of 2 minutes and 34 seconds.