Search CORE

11 research outputs found

Génération modulaire de grammaires formelles

Author: Petitjean Simon
Publication venue: HAL CCSD
Publication date: 11/12/2014
Field of study

The work presented in this thesis aim at facilitating the development of resources for natural language processing. Resources of this type take different forms, because of the existence of several levels of linguistic description (syntax, morphology, semantics, . . . ) and of several formalisms proposed for the description of natural languages at each one of these levels. The formalisms featuring different types of structures, a unique description language is not enough: it is necessary to create a domain specific language (or DSL) for every formalism, and to implement a new tool which uses this language, which is a long a complex task. For this reason, we propose in this thesis a method to assemble in a modular way development frameworks specific to tasks of linguistic resource generation. The frameworks assembled thanks to our method are based on the fundamental concepts of the XMG (eXtensible MetaGrammar) approach, allowing the generation of tree based grammars. The method is based on the assembling of a description language from reusable bricks, and according to a unique specification file. The totality of the processing chain for the DSL is automatically assembled thanks to the same specification. In a first time, we validated this approach by recreating the XMG tool from elementary bricks. Some collaborations with linguists also brought us to assemble compilers allowing the description of morphology and semantics.Les travaux présentés dans cette thèse visent à faciliter le développement de ressources pour le traitement automatique des langues. Les ressources de ce type prennent des formes très diverses, en raison de l’existence de différents niveaux d’étude de la langue (syntaxe, morphologie, sémantique,. . . ) et de différents formalismes proposés pour la description des langues à chacun de ces niveaux. Les formalismes faisant intervenir différents types de structures, un unique langage de description n’est pas suffisant : il est nécessaire pour chaque formalisme de créer un langage dédié (ou DSL), et d’implémenter un nouvel outil utilisant ce langage, ce qui est une tâche longue et complexe. Pour cette raison, nous proposons dans cette thèse une méthode pour assembler modulairement, et adapter, des cadres de développement spécifiques à des tâches de génération de ressources langagières. Les cadres de développement créés sont construits autour des concepts fondamentaux de l’approche XMG (eXtensible MetaGrammar), à savoir disposer d’un langage de description permettant la définition modulaire d’abstractions sur des structures linguistiques, ainsi que leur combinaison non-déterministe (c’est à dire au moyen des opérateurs logiques de conjonction et disjonction). La méthode se base sur l’assemblage d’un langage de description à partir de briques réutilisables, et d’après un fichier unique de spécification. L’intégralité de la chaîne de traitement pour le DSL ainsi défini est assemblée automatiquement d’après cette même spécification. Nous avons dans un premier temps validé cette approche en recréant l’outil XMG à partir de briques élémentaires. Des collaborations avec des linguistes nous ont également amené à assembler des compilateurs permettant la description de la morphologie de l’Ikota (langue bantoue) et de la sémantique (au moyen de la théorie des frames)

Une approche catégorique unifiée pour la récriture de graphes attribués

Author: Rebout Maxime
Publication venue: HAL CCSD
Publication date: 16/07/2008
Field of study

Due to the new requirements of modern software, researchers in software engineering have created more efficient development methods based on the concept of modeling (for example, the MDA) to control every stage of development. From a theoretical point of view, these methods are based on graphs and graph transformations. The theoretical difficulty lies in adding on these graphs data on which it must be possible to do computations. Our work has focused on developing a mathematical framework to implement these changes. The theories of categories (through the double pushout) and inductive types (very expressive computation functions) allowed us to provide a unified solution to this problem in which a single operation can transform the structure and compute with the attributes. In addition, the usual properties of rewriting systems are checked.En génie logiciel, les méthodes modernes de développement (ex. le MDA) s'appuient de manière cruciale sur les notions de modélisation et de transformation. Ces méthodes peuvent s'interpréter à l'aide de la théorie des graphes. La difficulté théorique réside aujourd'hui dans l'ajout sur ces graphes de données supplémentaires sur lesquelles il est nécessaire de pouvoir effectuer des calculs. Notre travail s'est focalisé sur le développement d'un cadre mathématique sûr afin d'appliquer ces transformations. Les théories des catégories (à travers le double pushout) et des types inductifs (fonctions de calcul très expressives) nous ont permis de donner une solution unifiée à ce problème dans laquelle une seule opération permet de travailler sur la structure et de calculer avec les attributs en définissant des fonctions entre graphes possédant une partie contravariante pour le travail sur les attributs. De plus, les propriétés usuelles des systèmes de récriture sont vérifiées

Thèses en ligne de l'Université Toulouse III - Paul Sabatier

DE LA MODELISATION A L'EXPLOITATION DES DOCUMENTS A STRUCTURES MULTIPLES

Author: Djemal Karim
Publication venue: HAL CCSD
Publication date: 03/06/2010
Field of study

With the recent development of new information and communication technologies, the paper documents are transformed to digital documents. Furthermore, it considers that the document is no longer seen as a whole, or as a monolithic bloc, but as organized entities. Exploiting these documents amount to identify and locate these entities. These entities are connected by relationships to give a "form" to document. Several types of relationships may occur, so that several "forms" of a document emerge. These different materializations of the same document are related to different uses of the same document and are essential for optimal management and shared of holdings. The work presented in this thesis aims to address the challenges of representing different materializations of a document through its representation of entities and their relationships. If those materializations are translated through structures, the issues are related to the representation of multistructured documents. Our work focuses mainly on the modeling, integration and exploitation of multistructured documents: (1) Proposal of multistructured document model. This model incorporates two levels of description: a specific level to describe each document through entities that compose and a generic level to identify document kinds through the grouping of similar structures. (2) Proposal of techniques for extracting structure (implicit or explicit) of a document (the specific level) and classification of this structure with respect to common structures (the generic level). The classification algorithm proposed includes a calculation of distance called "structural" (comparison of trees and graphs). This classification is associated with a process of verification of the "cohesion" of classes and possible reorganization of disrupted classes. (3) Proposal of document exploitation technical from their structures and their contents: (a) a document search that can reproduce documentary granules through criteria based on research of structures and / or content, (b) a multidimensional analysis that is to analyze and visualize the documentary information across multiple dimensions (of structures and / or content). In order to validate our proposals, we have developed a tool for integration and analysis of multistructured documents, called MDOCREP (Multistructured Document Repository). This tool provides on the one hand, the extraction and classification of document structures, and on the other hand, the querying and the multidimensional analysis of documents from their different structures.Avec l'évolution des nouvelles technologies de l'information et de la communication, les documents papier ont laissé la place aux documents numériques. On considère de plus que le document n'est plus vu comme un tout, ni comme un bloc monolithique, mais comme un ensemble organisé d'entités. Exploiter ces documents revient à identifier et retrouver ces entités. Ces dernières sont reliées par des relations permettant de donner une « forme » au document. Plusieurs types de relations peuvent apparaître, de sorte à ce que plusieurs « formes » d'un même document émergent. Ces différentes matérialisations d'un même document sont liées à des usages différents d'un même document et sont primordiales pour une gestion optimale et partagée des fonds documentaires. Les travaux présentés dans cette thèse visent à faire face aux défis de représentation des différentes matérialisations d'un document au travers de la représentation de ses entités et de leurs relations. Si ces matérialisations sont traduites par des structures, les enjeux concernent la représentation des documents à structures multiples. Nos travaux portent essentiellement sur la modélisation, l'intégration et l'exploitation des documents à structures multiples : (1) Proposition d'un modèle de documents multistructurés. Ce modèle intègre deux niveaux de description : un niveau spécifique permettant de décrire chaque document au travers des entités qui le composent et un niveau générique permettant de définir des typologies de documents au travers du regroupement de structures similaires. (2) Proposition des techniques d'extraction de structure (implicite ou explicite) d'un document (niveau spécifique) et de classification de cette structure par rapport à des structures communes (niveau générique). L'algorithme de classification proposé intègre un calcul d'une distance dite « structurelle » (comparaison d'arbres et de graphes). Cette démarche de classification est associée à une démarche de vérification de la « cohésion » des classes et de réorganisation éventuelle des classes perturbées. (3) Proposition de techniques d'exploitation des documents à partir de leurs structures et de leur contenu : (a) une recherche de documents qui permet de restituer des granules documentaires selon des critères de recherches basés sur la ou les structures et/ou le contenu ; (b) une analyse multidimensionnelle qui consiste à analyser et visualiser les informations documentaires selon plusieurs dimensions (de structures et/ou de contenu). Pour valider nos propositions, nous avons développé un outil d'aide à l'intégration et à l'analyse de documents à structures multiples, intitulé MDOCREP (Multistructured DOCument REPository). Cet outil assure d'une part, l'extraction et la classification des structures de documents, et d'autre part, l'interrogation et la restitution multidimensionnelle des documents à partir de leurs différentes structures

Thèses en ligne de l'Université Toulouse III - Paul Sabatier

Maîtrise de la qualité des transcriptions numériques dans les projets de numérisation de masse

Author: Ben Salah Ahmed
Publication venue: HAL CCSD
Publication date: 11/07/2014
Field of study

This work focuses on the assessment of characters recognition results produced automatically by optical character recognition software (OCR on mass digitization projects. The goal is to design a global control system robust enough to deal with BnF documents collection. This collection includes old documents which are difficult to be treated by OCR. We designed a word detection system to detect missed words defects in OCR results, and a words recognition rate estimator to assess the quality of word recognition results performed by OCR.We create two kinds of descriptors to characterize OCR outputs. Image descriptors to characterize page segmentation results and cross alignment descriptors to characterize the quality of word recognition results. Furthermore, we adapt our learning process to make an adaptive decision or prediction systems. We evaluated our control systems on real images selected randomly from BnF collection. The mmissed word detection system detects 84.15% of words omitted by the OCR with a precision of 94.73%. The experiments performed also showed that 80% of the documents of word recognition rate less than 98% are detected with an accuracy of 92%. It can also automatically detect 45% of the material having a recognition rate less than 70% with greater than 92% accuracy.Ce travail s’intéresse au contrôle des résultats de transcriptions numériques produites automatiquement par des logiciels de reconnaissance optique de caractères (OCR), lors de la réalisation de projets de numérisation de masse de documents. Le but de nos travaux est de concevoir un système de contrôle des résultats d’OCR suffisamment robuste pour être performant sur l’ensemble des documents numérisés à la BnF. Cettecollection est composée de documents anciens dont les particularités les rendent difficiles à traiter par les OCR, même les plus performants. Nous avons conçu un système de détection des mots omis dans les transcriptions, ainsi qu’une méthode d’estimation des taux dereconnaissance des caractères. Le contexte applicatif exclu de recourir à une vérité terrain pour évaluer les performances. Nous essayons donc de les prédire. Pour cela nous proposons différents descripteurs qui permettent de caractériser les résultats des transcriptions. Cette caractérisation intervient à deux niveaux. Elle permet d’une part de caractériser la segmentation des documents à l’aide de descripteurs de textures, et d’autres part de caractériser les textes produits en ayant recours à un second OCR qui joue le rôle d’une référence relative. Dans les deux cas, les descripteurs choisis permettent de s’adapter aux propriétés des corpus à contrôler. L’adaptation est également assurée par une étape d’apprentissage des étages de décision ou de prédiction qui interviennent dans le système. Nous avons évalué nos systèmes de contrôle sur des bases d’images réelles sélectionnées dans les collections documentaires de la BnF. Le système détecte 84, 15% des mots omis par l’OCR avec une précision de 94, 73%. Les expérimentations réalisées ont également permis de montrer que 80% des documents présentant un taux de reconnaissance mots inférieur à 98% sont détectés avec une précision de 92%. On peut également détecter automatiquement 45% des documents présentant un taux de reconnaissance inférieur à 70% avec une précision supérieure à 92%

Actes des 29es Journées Francophones d'Ingénierie des Connaissances, IC 2018

Author: Ranwez Sylvie
Publication venue: HAL CCSD
Publication date: 04/07/2018
Field of study

International audienc

Complexification des données et des techniques en linguistique : contributions du TAL aux solutions et aux problèmes

Author: Tanguy Ludovic
Publication venue: HAL CCSD
Publication date: 11/09/2012
Field of study

Ce mémoire d'habilitation est l'occasion de faire le bilan de mon activité d'enseignant-chercheur en traitement automatique des langues (TAL) dans un laboratoire de linguistique (CLLE-ERSS) et des principales évolutions de l'outillage informatique de la linguistique au cours des 15 dernières années. Mes recherches portent notamment sur le repérage de structures morphosyntaxiques dans les textes, l'analyse des structures du discours et l'acquisition de ressources lexicales à partir de corpus. Certaines se positionnent dans des cadres applicatifs comme la recherche d'information et la classification de textes, mais aussi dans des contextes plus spécifiques en lien avec d'autres disciplines (médecine, psychologie, sociologie...). En m'appuyant sur la diversité de ces travaux et de mes collaborations, j'identifie quatre dimensions d'évolution principales : - l'augmentation de la masse de données langagières disponibles et notamment la part croissante de l'utilisation du Web comme corpus ; - la complexification de l'outillage informatique disponible pour gérer la masse et la variété des données accessibles (outils de constitution et d'interrogation de corpus) ; - la complexification de l'annotation des données langagières, qu'elle soit manuelle, assistée ou automatique ; - la montée en puissance, en TAL mais aussi en linguistique descriptive, des méthodes quantitatives (depuis l'analyse statistique jusqu'aux techniques de fouille de données et d'apprentissage). Si les avancées techniques du TAL ont permis d'accroître de façon conséquente les potentialités d'investigation du matériau langagier, et dans certains cas de dégager de nouveaux questionnements, elles ont aussi contribué à creuser un fossé entre les deux composantes (informatique et linguistique) de la discipline. A travers ma propre expérience d'acteur ou d'accompagnateur de ces changements et avec une vocation de "passeur" interdisciplinaire, je cherche à dégager les principaux enjeux actuels pour la linguistique outillée : - doter la linguistique descriptive d'outils de visualisation de données pour aborder la complexité, en exploitant les avancées théoriques et techniques de ce nouveau champ disciplinaire et en les adaptant aux spécificités du matériau langagier ; - rendre abordables aux linguistes les techniques fondamentales de l'analyse statistique, mais aussi les méthodes d'apprentissage artificiel seules capables d'assister l'investigation et l'exploitation de données massives et complexes ; - replacer la linguistique au sein des développements actuels du TAL, notamment par le biais de l'utilisation de descripteurs linguistiques riches dans les outils de traitement par apprentissage, pour un bénéfice mutuel

Une archéologie de la logique du sens : arithmétique et contenu dans le processus de mathématisation de la logique au XIXe siècle

Author: Gastaldi Juan Luis
Publication venue: HAL CCSD
Publication date: 26/09/2014
Field of study

This work aims at providing a new general interpretation of the logic that was born with the work of Gottlob Frege, in order to make explicit one of the most decisive conditions of contemporary philosophy: the one that concerns the relation of philosophy to formal practices and knowledge. Its initial hypothesis states that Frege’s primary and most constant project was that of building a logic of content. However, the intelligibility thus gained does not intend to unearth a new underlying unity of Frege’s thought; it rather aims at localising the real gaps within Frege’s formulations that have not been identified as such until now. Still, those gaps do not require to be filled, for Frege’s logic is indeed effective despite this indeterminacy. Rather than the gaps, it is this ungrounded effectiveness that needs to be explained. Our answer to this question is that the effectiveness of Frege’s logic as a logic of content comes from a certain relationship with Arithmetic; in fact, Frege’s logic is constructed on the template of Arithmetic, before it becomes capable of constructing Arithmetic in turn. The task then arises to characterise precisely, at this constitutive and non-foundational level, the nature of the relation between a logic of content as a specific form of logic in the framework of its mathematization, and Arithmetic as a particular mathematical domain. From the meticulous study of the constitution of the Fregean system, an idea can be drawn that constitutes the central argument of this thesis: the various mathematical or formalised logical systems rest upon mathematics only through an intermediary dimension consisting in the practice, the reflection and the elaboration of signs, where the circulations between these two contemporary domains of formal knowledge (mathematics and logic) are constructed and justified. From this point of view, we then lay out a detailed study of the rise of the two most significant projects for formalizing logic in the nineteenth century: Frege’s and Boole’s (and the Booleans’). In the space leading from mathematical practices to logical systematisations through semiotic functioning, two general schemes or semiotic formal regimes can be drawn: “Symbolic Abstraction”, leading from abstract Algebra to Boolean propositional logic; and “Expressionism”, leading from Arithmetic to Predicate Calculus, associated to Frege’s work. More deeply, our research reveals a deep connexion between logical content and Arithmetic (understood as the theory of integers), which horizontally crosses the different semiotic regimes. Following the multiple dimensions of this nexus – which is responsible for the introduction of the category of sense in the framework of mathematized logic – a formal theory of expression can be drawn, which defines the conditions for the actual development of a logic of sense.Ce travail s’engage dans la reconstitution d’une intelligibilité globale nouvelle pour la logique qui est née avec Frege afin de restituer l’une des conditions décisives pour la philosophie contemporaine, à savoir celle qui concerne son rapport aux pratiques et aux savoirs formels. Son hypothèse initiale affirme que le projet premier et constant de Frege a été celui d’une logique du contenu. Pourtant, il ne s’agit pas de réinvestir l’œuvre de Frege d’une cohérence nouvelle dans le but de rétablir une unité stable. Car l’intelligibilité procurée par cette reconstitution permet de localiser dans les formulations de Frege de véritables lacunes qui ne semblent pas avoir été identifiées comme telles jusqu’ici. Que la logique de Frege soit efficace malgré ces lacunes, voilà ce qu’il faut expliquer. La réponse que nous donnons à ces questions est que l’efficacité de la logique de Frege en tant que logique du contenu provient d’un certain rapport à l’Arithmétique, à savoir celui par lequel c’est la logique qui est construite d’après les principes de l’Arithmétique, avant qu’elle ne soit capable de la construire à son tour. La question se pose alors de caractériser avec précision à ce niveau constitutif, non « fondationnel », la nature du rapport entre une logique du contenu comme forme spécifique de la logique dans le cadre de sa mathématisation, et l’Arithmétique comme domaine mathématique particulier. De l’analyse minutieuse de la constitution du système logique frégéen, une idée se dégage qui constitue la thèse centrale de notre travail : les différents systèmes de la logique mathématisée ou formelle ne reposent sur les mathématiques que par l’intermédiaire d’une dimension d’exercice, de réflexion et d’élaboration de signes, où les circulations et les emprunts entre ces deux savoirs formels contemporains que sont les mathématiques et la logique se construisent et se justifient. C’est donc cette thèse qu’il s’agit de démontrer, par une étude détaillée des processus d’émergence des deux plus grands projets de formalisation de la logique du XIXe siècle : celui de Frege et celui de Boole et des Booléens. Dans cet espace qui mène des pratiques mathématiques aux systématisations logiques à travers les fonctionnements des signes, deux régimes généraux se dessinent : celui d’ « Abstraction symbolique » qui mène de l’Algèbre abstraite à la Logique propositionnelle booléenne ; et celui de l’ « Expressionnisme », qui mène de l’Arithmétique au Calcul logique des prédicats, associée aux travaux de Frege. Mais plus profondément, par l’effet d’une lecture symptomale au plus près des dynamiques internes à ces processus, le présent travail décèle un lien transversal entre le contenu logique d’une part et l’Arithmétique comme ensemble des déterminations du nombre de l’autre. En suivant ce lien, qui s’avère le responsable de l’introduction de la catégorie de sens dans le cadre de la logique mathématisée, une théorie de l’expression formelle se dessine, définissant les conditions pour le développement d’une logique du sens

Actes de la conférence Traitement Automatique de la Langue Naturelle, TALN 2018: Volume 2 : Démonstrations, articles des Rencontres Jeunes Chercheurs, ateliers DeFT

Author: Cellier Peggy
Claveau Vincent
Grouin Cyril
Ligozat Anne-Laure
Minard Anne-Lyse
Paroubek Patrick
Publication venue: HAL CCSD
Publication date: 14/05/2018
Field of study

International audienc

INRIA a CCSD electronic archive server

Manager l'interface. Approche par la complexité du processus collaboratif de conception, d'intégration et de réalisation (modèle transactionnel de l'acteur d'interface et dynamique des espaces d'échanges)

Author: BOUJUT Jean-François
NICQUEVERT Bertrand
Publication venue
Publication date: 01/01/2012
Field of study

Dans de grands projets tels qu accélérateurs ou détecteurs de particules, les interfaces et les frontières se révèlent à la fois critiques et sous-estimées. Le manageur technique, acteur parmi les autres, se trouve placé à des nœuds de réseau où il doit mettre en œuvre des espaces d'échanges afin de susciter des conduites collaboratives. À partir d études de cas issus du terrain du CERN, la thèse adopte trois principes issus de la littérature de la complexité, les principes dialogique,hologrammique et d auto-éco-organisation. Elle propose une construction méthodologique matricielleoriginale menant à l'élaboration d'un modèle transactionnel de l acteur d interface.L espace d échanges collaboratif devient le lieu où se déploie la dynamique de transformation del acteur d interface en acteur-frontière. Les objets intermédiaires élaborés lors du processus deconception / intégration y sont simultanément transformés en objets frontières, qui sont mobiliséspour la réalisation du produit dans le cadre récursivement déterminé du projet. L intérêt d uneapproche globale et couplée de cette dynamique des espaces d'échanges conduit à proposer un hypercompas afin d'orienter l agir penser du manageur technique.An approach through the complexity of the collaborative process of design, integration and realization:a transactional model of the interface actor and dynamics of exchange spacesAbstractIn large projects such as particle accelerators or detectors, interfaces and boundaries revealthemselves to be both critical and underestimated. The technical manager, an actor among others,finds himself placed at network nodes where he must set up exchanges spaces in order to generatecollaborative behaviours. Starting with case studies from the field of CERN, the thesis follows threeprinciples based on the dialogical, the hologramic and the self-eco-organization principles, asexpanded in the writings on complexity. It puts forward an original methodological matrix constructionleading to a transactional model of the interface actor.The collaborative exchanges spaces builds itself as a place for the dynamic transformation of theinterface actor into a boundary actor. Intermediate objects, created during the design / integrationprocess, are simultaneously transformed into boundary objects. They are instrumental in therealization of the product: this takes place in the framework of the project which has been determinedthrough a recursive process. The interest generated by such a global and combined approach of thisdynamic process leads to the proposal of a hypercompass , with the aim of providing the means forthe technical manager to orient his acting thinking .SAVOIE-SCD - Bib.électronique (730659901) / SudocGRENOBLE1/INP-Bib.électronique (384210012) / SudocGRENOBLE2/3-Bib.électronique (384219901) / SudocSudocFranceF