DSpace DSpace UPC
 Català   Castellano   English  

E-prints UPC >
Altres >
Enviament des de DRAC >

Empreu aquest identificador per citar o enllaçar aquest ítem: http://hdl.handle.net/2117/15661

Arxiu Descripció MidaFormat
paper-1.pdfArticle LREC 2012151.96 kBAdobe PDFThumbnail
Veure/Obrir

Citació: Atserias, J. [et al.]. Spell-checking in Spanish: the case of diacritic accents. A: International Conference on Language Resources and Evaluation. "2012 International Conference on Language Resources and Evaluation : proceedings". Istanbul: 2012, p. 1-6.
Títol: Spell-checking in Spanish: the case of diacritic accents
Autor: Atserias Batalla, Jordi Veure Producció científica UPC; Fuentes Fort, Maria Veure Producció científica UPC; Nazar, Rogelio; Renau, Irene
Data: 2012
Tipus de document: Conference lecture
Resum: This article presents the problem of diacritic restoration (or diacritization) in the context of spell-checking, with the focus on an orthographically rich language such as Spanish. We argue that despite the large volume of work published on the topic of diacritization, currently available spell-checking tools have still not found a proper solution to the problem in those cases where both forms of a word are listed in the checker’s dictionary. This is the case, for instance, when a word form exists with and without diacritics, such as continuo ‘continuous’ and continuó ‘he/she/it continued’, or when different diacritics make other word distinctions, as in continúo ‘I continue’. We propose a very simple solution based on a word bigram model derived from correctly typed Spanish texts and evaluate the ability of this model to restore diacritics in artificial as well as real errors. The case of diacritics is only meant to be an example of the possible applications for this idea, yet we believe that the same method could be applied to other kinds of orthographic or even grammatical errors. Moreover, given that no explicit linguistic knowledge is required, the proposed model can be used with other languages provided that a large normative corpus is available.
URI: http://hdl.handle.net/2117/15661
Apareix a les col·leccions:Altres. Enviament des de DRAC
Departament de Llenguatges i Sistemes Informàtics. Ponències/Comunicacions de congressos
GPLN - Grup de Processament del Llenguatge Natural. Ponències/Comunicacions de congressos
Comparteix:


Stats Mostra les estadístiques d'aquest ítem

SFX Query

Queda prohibida la reproducció, transformació, distribució i comunicació pública d'aquesta obra. Es permet, en tot cas, la reproducció per a ús privat sempre i quan la còpia que se'n faci no sigui objecte d'utilització col·lectiva ni lucrativa (art. 31.2 del Reial Decret Legislatiu 1/1996, de 12 d'abril, pel qual s'aprova el Text Refós de la Llei de Propietat Intel·lectual, http://bibliotecnica.upc.es/sepi/legislacio.asp).

Per a qualsevol ús que es vulgui fer diferent al permès, dirigiu-vos a: sepi@upc.edu

 

Valid XHTML 1.0! Programari DSpace Copyright © 2002-2004 MIT and Hewlett-Packard Comentaris
Universitat Politècnica de Catalunya. Servei de Biblioteques, Publicacions i Arxius