Published May 30, 2011 | Version v1
Dataset Restricted

TüBa-E/S: Tübinger Baumbank des Englischen/Spontansprache

  • 1. ROR icon University of Tübingen

Description

Die TüBa-E/S-Baumbank wurde im Projekt Verbmobil erstellt. Verbmobil war ein langfristig angelegtes Projekt zur maschinellen Übersetzung von Spontansprache, das vom Bundesministerium für Bildung und Forschung (BMBF) gefördert wurde. Die Tübinger Baumbank des Englischen / Spontansprache (TüBa-E/S) ist ein syntaktisch annotiertes Korpus auf der Grundlage von spontansprachlichen Dialogen, die manuell transliteriert wurden. Sie umfasst ca. 30.000 Sätze bzw. 310.000 Wörter. Die Annotation erfolgte von Hand. Die syntaktische Annotation basiert auf HPSG-Prinzipien. Das Annotationsschema unterscheidet drei Ebenen syntaktischer Konstituenz: die lexikalische Ebene, die phrasale Ebene und die Satzebene. Zusätzlich zur Konstituentenstruktur sind die Kanten zwischen den Knoten mit Labels annotiert. Diese Kantenlabels beschreiben grammatische Funktionen (als Relationen zwischen Phrasen) sowie die Unterscheidung zwischen Head und Non-Head (phrasenintern).

Other (English)

The TüBa-E/S treebank was annotated in the project Verbmobil. Verbmobil was a longterm Machine Translation project for spontaneous speech funded by the Federal Ministry of Education and Research (BMBF). The Tübingen Treebank of Spoken English, TüBa-E/S, is a syntactically annotated corpus based on spontaneous dialogues, which were manually transliterated. The treebank comprises approximately 30 000 sentences (ca. 310 000 words). The syntactic annotation was performed manually. The syntactic annotation is HPSG oriented. The annotation scheme distinguishes three levels of syntactic constituency: the lexical level, the phrasal level, and the clausal level. In addition to constituent structure, annotated trees contain edge labels between nodes. These edge labels encode grammatical functions (as relation between phrases) and the distinction between heads and non-heads (as phrase-internal relations).

Files

Restricted

The record is publicly accessible, but files are restricted to users with access.

Additional details

Additional titles

Alternative title (English)
TüBa-E/S: Tübingen Treebank of Spoken English

Funding

Bundesministerium für Forschung, Technologie und Raumfahrt

Data quality

Accuracy

Not specified.

Completeness

Not specified.

Conformity

Not specified.

Consistency

Not specified.

Credibility

Not specified.

Processability

Not specified.

Relevance

Not specified.

Timeliness

Not specified.

Understandability

Not specified.