Location of Repository

Sistema de conversión texto-voz en lengua gallega basado en la selección combinada de unidades acústicas y prosódicas

By Eduardo Rodríguez Banga, Francisco Campillo Díaz, Elisa Fernández Rei and Francisco Méndez Pazó

Abstract

En esta comunicación se describe un sistema de conversión texto-voz en lengua gallega basado en las denominadas “técnicas de síntesis basadas en corpus”. A diferencia de los tradicionales sintetizadores de voz por concatenación, que normalmente utilizan un conjunto de unidades de síntesis reducido, los sistemas de síntesis basados en corpus consideran múltiples realizaciones de cada unidad y, mediante técnicas de programación dinámica, seleccionan aquella secuencia de unidades que minimiza una función de coste. Por otro lado, tradicionalmente, la generación de la información prosódica se realiza en una etapa previa a la selección de unidades, lo que ocasiona que en muchas ocasiones sea necesario manipular en exceso las unidades seleccionadas con el fin de ajustarlas a la entonación, duración y energía deseadas. En este artículo también se propone la selección conjunta del contorno entonativo y de las unidades de síntesis, con objeto de minimizar la distorsión causada por las modificaciones prosódicas.In this contribution we describe a corpus-based text-to-speech system for Galician. While traditional concatenative speech-synthesis systems generally employ a quite reduced set of speech units, corpus-based synthesis systems consider many instances of every unit and, by means of dynamic programming techniques, select the sequence of units that minimizes a cost function. With reference to prosody, traditionally, the generation of the prosodic information is carried out in a previous stage to unit selection. This fact implies that, in many cases, the selected speech units must be manipulated in excess in order to fit the desired prosody. In this paper we also propose a method for combined selection of the intonation contour and the sequence of speech units in order to minimize the distortion due to prosodic modifications

Topics: Síntesis de voz, Conversión texto-voz, Síntesis basada en corpus, Entonación, Speech synthesis, Text-to-speech, Corpus-based synthesis, Intonation
Publisher: Sociedad Española para el Procesamiento del Lenguaje Natural
Year: 2002
OAI identifier: oai:rua.ua.es:10045/1710
Journal:
Download PDF:
Sorry, we are unable to provide the full text but you may find it at the following location(s):
  • http://hdl.handle.net/10045/17... (external link)
  • Suggested articles

    Preview


    To submit an update or takedown request for this paper, please submit an Update/Correction/Removal Request.