Pour pouvoir créer des nuages de mots (et pour nos futures analyses avec itrameur) nous avons dû créer des gros fichiers contenant les textes de chaque URLs. Nous avons donc créé un gros fichier par langue et dans ces gros fichiers, chacun des textes...
Lire la suite
Après beaucoup de travail, nous avons fini notre script. voici un flowchart de script: Ce script va créer automatiquement des tableaux au format HTML selon le nombre des langues. Comme nous avons 4 langues à traiter, il va créer 4 tableaux. D'ailleurs,...
Lire la suite
La semaine dernière, nous avons écrit le script pour traiter des corpus japonais. Cependant, ce script n'a pas marché pour tout le monde et chaque personne a un problème différent.Heureusement, nous avons pu résoudre les problèmes de chaque côté, nous...
Lire la suite
Le japonais n'ayant pas d'espace comme en français, l'expression régulière "\w+" ne peut pas reconnaître correctement les mots japonais. Nous devons donc utiliser une autre méthode pour segmenter nos textes japonais. Nous avons trouvé cette méthode sur...
Lire la suiteNous avons rencontré un problème pour récupérer des URLs "en anglais". La dernière fois, nous avions récupéré des URLs de sites internets de toutes les langues que nous avons choisi, en utilisant un algorithme. Cependant dans la liste des URLs anglaises,...
Lire la suite
Nous avons récupérer 50 URLs de sites internet contenant le mot manifestation dans les quatre langues que nous avons choisi d'étudier. Afin de récupérer ces URLs nous avons utilisé l'algorithme suivant : Cela nous permet de créer quatre fichiers de chaque...
Lire la suite
Ecrire un script (dans le dossier PROGRAMMES) permettant de générer dans le répertoire TABLEAUX un fichier html contenant 1 tableaux avec 2 lignes (sur la première, votre nom, sur la seconde, le mot choisi pour votre projet)
Lire la suite
Ecrire un script (dans le dossier PROGRAMMES) permettant de générer dans le répertoire DUMP‐TEXT un fichier txt contenant 2 lignes (sur la première, votre nom, sur la seconde, le mot choisi pour votre projet)
Lire la suite
Bonjour! こんにちは! Hello ! 你好! Ce blog a été créé dans le cadre d'un projet encadré en M1 de Traitement Automatique des Langues. Nous sommes trois étudiantes, Mei Gan, Chinatsu Kuroiwa et Anaëlle Pierredon. Le but de ce projet est de créer un corpus à partir...
Lire la suite