DSpace DSpace UPC
 Català   Castellano   English  

E-prints UPC >
Altres >
Enviament des de DRAC >

Empreu aquest identificador per citar o enllaçar aquest ítem: http://hdl.handle.net/2117/7551

Arxiu Descripció MidaFormat
222_Paper.pdf378,63 kBAdobe PDFThumbnail
Veure/Obrir

Citació: Reese, S. [et al.]. Word-sense disambiguated multilingual Wikipedia corpus. A: International Conference on Language Resources and Evaluation. "7th International Conference on Language Resources and Evaluation". La Valetta: 2010.
Títol: Word-sense disambiguated multilingual Wikipedia corpus
Autor: Reese, Samuel; Boleda Torrent, Gemma Veure Producció científica UPC; Cuadros Oller, Montserrat Veure Producció científica UPC; Padró, Lluís Veure Producció científica UPC; Rigau Claramunt, German Veure Producció científica UPC
Data: mai-2010
Tipus de document: Conference report
Resum: This article presents a new freely available trilingual corpus (Catalan, Spanish, English) that contains large portions of the Wikipedia and has been automatically enriched with linguistic information. To our knowledge, this is the largest such corpus that is freely available to the community: In its present version, it contains over 750 million words. The corpora have been annotated with lemma and part of speech information using the open source library FreeLing. Also, they have been sense annotated with the state of the art Word Sense Disambiguation algorithm UKB. As UKB assignsWordNet senses, andWordNet has been aligned across languages via the InterLingual Index, this sort of annotation opens the way to massive explorations in lexical semantics that were not possible before. We present a first attempt at creating a trilingual lexical resource from the sense-tagged Wikipedia corpora, namely, WikiNet. Moreover, we present two by-products of the project that are of use for the NLP community: An open source Java-based parser for Wikipedia pages developed for the construction of the corpus, and the integration of the WSD algorithm UKB in FreeLing.
URI: http://hdl.handle.net/2117/7551
Versió de l'editor: http://www.lrec-conf.org/proceedings/lrec2010/pdf/222_Paper.pdf
Apareix a les col·leccions:GPLN - Grup de Processament del Llenguatge Natural. Ponències/Comunicacions de congressos
Departament de Llenguatges i Sistemes Informàtics. Ponències/Comunicacions de congressos
Altres. Enviament des de DRAC
Comparteix:


Stats Mostra les estadístiques d'aquest ítem

SFX Query

Tots els drets reservats. Aquesta obra està protegida pels drets de propietat intel·lectual i industrial corresponents. Sense perjudici de les exempcions legals existents, queda prohibida la seva reproducció, distribució, comunicació pública o transformació sense l'autorització del titular dels drets.

Per a qualsevol ús que se'n vulgui fer no previst a la llei, dirigiu-vos a: sepi.bupc@upc.edu

 

Valid XHTML 1.0! Programari DSpace Copyright © 2002-2004 MIT and Hewlett-Packard Comentaris
Universitat Politècnica de Catalunya. Servei de Biblioteques, Publicacions i Arxius