Sumarização Automática Multidocumento

Tamanho: px
Começar a partir da página:

Download "Sumarização Automática Multidocumento"

Transcrição

1 I m p l e m e n t a ç ã o d e u m M é t o d o L i n g u í s t i c o p a r a a S u m a r i za ç ã o A u t o m á t i c a M u l t i d oc u m e n t o Guilherme Gonçalves, Thiago A. S. Pardo Núcleo Interinstitucional de Linguística Computacional (NILC) Instituto de Ciências Matemáticas e de Computação, Universidade de São Paulo guilherme3.goncalves@usp.br, taspardo@icmc.usp.br RESUMO Este trabalho apresenta os estudos realizados na área de Processamento de Línguas Naturais (PLN), mais especificamente em Sumarização Automática Multidocumento (SAM). Nesse artigo, são descritos os passos para a produção de um protótipo computacional que seja capaz de realizar a SAM para a língua portuguesa, desde as investigações previamente realizadas na área à implementação de um algoritmo com base em linguística. 1. INTRODUÇÃO Atualmente, temos acesso a um volume de dados tão grande que, muitas vezes, não conseguimos processar todas as informações e transformá-las em conhecimento. Além disso, cada vez menos dispomos de tempo para atividades como essas. Assim, é necessária uma forma eficiente e rápida de assimilar informações. Diante dessa dificuldade, uma ferramenta de sumarização multidocumento se mostra interessante e vantajosa. A Sumarização Automática Multidocumento (SAM) consiste na produção automática de um único sumário (também chamado resumo) a partir de um grupo de textos sobre um mesmo tópico ou sobre tópicos relacionados (Mani, 2001). A SAM seleciona as informações potencialmente mais relevantes, evitando que se perca tempo, identificando e excluindo informações desnecessárias e menos importantes. Dessa maneira, ela norteia o leitor a saber se o assunto tratado em um texto ou em uma coleção de textos é realmente de seu interesse. Como ilustração, a Figura 1 mostra um exemplo de sumário multidocumento produzido manualmente a partir de dois textos jornalísticos que reportavam problemas de saúde de um ex-jogador de futebol. Maradona voltou a ter problemas de saúde no fim de semana e foi internado novamente em um hospital em Buenos Aires. Ele teve uma recaída da hepatite aguda. Ele melhorou e está estável, mas continuará internado. Maradona desenvolveu hepatite por excesso de álcool, mas, nesta recaída, ele não estava bebendo e a causa ainda é indeterminada, segundo seu médico. Figura 1. Exemplo de sumário multidocumento Os trabalhos na área de Processamento de Línguas Naturais (PLN), área a qual a SAM pertence, geralmente seguem as seguintes etapas: de estudo linguístico, representacional e a de implementação. Na etapa de estudos linguísticos, são realizadas as investigações dos métodos e atributos utilizados pelos humanos na tarefa. Já na representacional, ocorre a formalização das estratégias identificadas. Finalmente, na etapa de implementação, ocorre a produção de sistemas computacionais que empregam o que foi definido nas etapas anteriores.

2 Na SAM, os trabalhos realizados normalmente apresentam os seguintes processos: análise, transformação e síntese. No processo inicial de análise, um ou mais textos-fonte são processados e uma representação interna com todo o conteúdo dos textos é produzida. Essa representação deve ser formal o suficiente para ser processada automaticamente. O processo de transformação realiza a seleção de conteúdo sobre a representação interna dos textosfonte, produzindo a representação interna do sumário, a qual contém o conteúdo mais importante a ser veiculado textualmente. Por fim, o processo de síntese expressa em língua natural a representação interna do sumário. Em uma abordagem pioneira, Camargo (2013) estudou os fundamentos linguísticos da SAM para formalizar estratégias de seleção de conteúdo para compor o sumário (no âmbito da etapa de transformação, portanto). Este trabalho utiliza os métodos definidos por Camargo, sendo um dos primeiros a utilizar métodos linguísticos para o português brasileiro, o que o torna inovador. A proposta é produzir um sistema computacional que seja capaz de produzir sumários informativos e úteis aos humanos. 2. Trabalhos Relacionados Na SAM, podemos encontrar dois tipos de abordagens: a superficial e a profunda. Na superficial, utilizam-se métodos estatísticos e empíricos, que podem ser modelados por atributos, que ditam quais sentenças devem ir para o sumário, podendo ser, por exemplo, a primeira sentença de um texto-fonte, aquela que contêm as palavras mais frequentes ou ainda sentenças que tenham seu tamanho dentro de uma certa faixa pré-determinada. Na abordagem profunda, faz-se uso de mais conhecimento linguístico para se interpretar o conteúdo textual e selecionar as informações que comporão o sumário de forma mais consistente. Por exemplo, podese fazer uso de recursos e modelos semânticos e discursivos para relacionar as partes dos vários textos e detectar e tratar apropriadamente os vários fenômenos multidocumento, que incluem as similaridades e diferenças que existem entre os textos a serem sumarizados. Na SAM, um dos modelos discursivos mais utilizados é a CST (Cross-document Structure Theory) (Radev, 2000), que prevê que os segmentos textuais de vários textos sobre um mesmo tópico podem apresentar relações como equivalência, contradição, elaboração, subsunção e atribuição, dentre várias outras. O trabalho de Camargo (2013) considera o fato de que sumários são compostos por informações que apresentam características recorrentes, a ponto de revelar estratégias de sumarização. Em seu trabalho, Camargo utilizou os textos-fonte das 50 coleções do corpus multidocumento para o português brasileiro CSTNews (Cardoso et al., 2011) para realizar sua investigação. Camargo identificou que as sentenças selecionadas para compor os sumários multidocumento comumente apresentam certos atributos, como localização das sentenças no texto e redundância. Essa constatação foi confirmada pelo conjunto de regras formais aprendidas por um algoritmo de Aprendizado de Máquina (AM) a partir das caracterizações encontradas em sua investigação. A Figura 2 apresenta algumas das regras geradas pelo algoritmo de AM. Essas regras são aplicadas a cada sentença dos textos-fonte e indicam que sentenças devem ser selecionadas para compor o sumário. Nesse caso, o sumário chamado extrato é formado pela simples justaposição de sentenças selecionadas. Na SAM, a redundância é um atributo que influencia fortemente na escolha de conteúdo, uma vez que a redundância indica as informações mais importantes presentes nos textos-fonte. Trabalhos anteriormente realizados na área constataram que informações que aparecem muitas vezes são

3 consideradas importantes nos textos. Pelo fato dos autores ficarem retomando as mesmas informações, isso indica que elas devem ser salientadas no sumário correspondente. Dessa maneira, considera-se que informações redundantes expressão o assunto principal dos textos na maior parte das vezes. No entanto, para se compor o sumário, não é interessante que as sentenças selecionadas apresentem redundância. Nesse contexto, trabalhos como o de Souza (2012) investigam métodos de identificação da redundância entre sentenças a serem inseridas em um sumário. Se uma sentença estiver no início de algum texto, ela deve ser selecionada para o sumário. Senão, se ela tiver grande redundância com as demais do texto, ela deve ser selecionada para o sumário. Senão, se a redundância for baixa, mas suas palavras forem frequentes, ela deve ser selecionada para o sumário. Senão, ela não deve ser selecionada para o sumário. Figura 2. Regras geradas pelo algoritmo de AM No protótipo desenvolvido neste trabalho, implementam-se as regras de seleção de conteúdo obtidas por Camargo. Em termos de remoção de redundância no sumário, pretende-se utilizar o método desenvolvido por Souza. 3. Material e métodos Nessa seção, será descrito o trabalho realizado até o presente momento, ou seja, o estado da ferramenta de sumarização que o projeto tem como finalidade. Inicialmente, o protótipo computacional realiza o pré-processamento dos textos-fonte. Para o pré-processamento, é realizada a leitura dos textos-fonte, que precisam estar no mesmo diretório onde se encontra o arquivo executável do protótipo. Além do executável, é necessário que esteja no mesmo diretório o arquivo que contêm a stoplist, ou seja, uma lista formada por stopwords, palavras que não expressam conteúdo relevante dentro da sentença. Em geral, essas palavras são descartadas durante o processo de sumarização, pois podem interferir nos resultados. Para poder realizar tanto a análise morfológica como sintática das sentenças é utilizado o software Palavras (Bick, 2000). O Palavras apoia-se num léxico de lemas e milhares de regras gramaticais para fornecer uma análise completa. Esse software baseia-se na Constraint Grammar (Karlsson et al., 1995). Nesse paradigma, as regras dependentes de contexto são compiladas em uma gramática que atribui etiquetas gramaticais (grammatical tags) a palavras ou outros símbolos (tokens) em texto. O Palavras gera para cada texto um arquivo de saída na forma ilustrada pela Figura 3 a seguir. Como se vê na figura, a análise foi feita para a frase Mesmo após lei, prazo para tratar câncer ainda é descumprido no país. Cada palavra é mostrada em uma linha, acompanhada de suas informações linguísticas. Desse processamento, são extraídas importantes definições sobre as palavras dentro das sentenças. Para a linha: é [ser] <fmc> <aux> V PR 3S IND #10->0, o lema encontra-se entre colchetes, e o V indica que a palavra é um verbo. As definições extraídas são utilizadas para o cálculo de atributos, como tamanho da sentença e frequência das palavras lematizadas, que posteriormente são utilizados para a seleção de conteúdo que formará o sumário.

4 Mesmo [mesmo] <*> <quant> #1->2 após [após] #2->0 lei [lei] <conv> <percep-f> N F #3->2 $, #4->0 prazo [prazo] <clb> <per> <temp> N M #5->10 para [para] <np-close> #6->5 tratar [tratar] <mv> V INF #7->6 câncer [câncer] <sick-c> N M #8->7 ainda [ainda] #9->11 é [ser] <fmc> <aux> V PR 3S IND STA #10->0 descumprido [descumprir] <vh> <mv> V PCP M #11->10 em [em] <sam-> #12->11 o [o] <-sam> <artd> DET M #13->14 país [país] <Lciv> N M #14->12 $. #15->0 Figura 3. Modelo de saída do Palavras (Bick, 2000) O processamento dos arquivos de saída do Palavras é realizado representando as sentenças e palavras por meio de listas encadeadas. Listas encadeadas se mostraram úteis pelo fato de não apresentarem limites prévios de elementos, pois o número de sentenças de um texto para o outro varia muito e o mesmo acontece de sentença para sentença dentro de um mesmo texto. Assim, a estrutura de dados ficou como uma lista de textos-fonte, onde cada texto-fonte possui uma lista de sentenças e cada sentença possui sua lista de palavras, e cada palavra é acompanhada de suas informações linguísticas. O próximo passo foi calcular os atributos segundo o trabalho de Camargo (2013). Para cada atributo, há uma sub-rotina que percorre a estrutura de dados, realizando a contagem para cada sentença e definindo o valor do atributo em questão para a mesma. Ao final, normalizam-se os valores para que discrepâncias nos dados sejam evitadas. Essas discrepâncias advêm das diferenças de tamanho entre sentenças e textos. Sendo assim, a normalização garante um tratamento mais uniforme dos dados. Já para os atributos profundos do método de Camargo, que são fornecidos pela teoria CST (Radev, 2000), foi necessário realizar a busca em documentos que continham a catalogação das relações para os textos. Tal catalogação foi realizada anteriormente por estudiosos da área de linguística computacional. As relações da CST são responsáveis por fornecer, por exemplo, a informação sobre a redundância das sentenças, que, como já foi dito, é um atributo muito importante na SAM. Esses valores também são normalizados. 4. Resultados e Discussão Atualmente o protótipo realiza o cálculo de todos os atributos necessários para a seleção de conteúdo. Esses cálculos são realizados com um índice de acerto próximo aos calculados no trabalho de Camargo (2013). Foram realizadas comparações manuais para os valores calculados e os presentes no trabalho de Camargo, apresentando uma grande proximidade. As diferenças possivelmente são devidas ao fato de o algoritmo estar em fase de desenvolvimento, necessitando de possíveis ajustes. Para dar continuidade ao protótipo, o próximo passo é implementar o conjunto de regras que norteiam a seleção de conteúdo. Essas regras são as mesmas definidas por Camargo em sua investigação. Mais adiante, deve-se implementar o método de Souza (2012) para que as sentenças do sumário não apresentem redundância entre si. Ao final de tudo, pretende-se avaliar o sistema. Essa avalição será realizada aplicando-se a medida de avaliação ROUGE (Recall-Oriented Understudy for Gisting Evaluation) (Lin e Hovy, 2003), fortemente empregada na área de sumarização. A medida ROUGE realiza a comparação do sumário automático com o sumário humano, por meio da co-ocorrência de n-gramas, que consiste

5 em verificar a média de quantas vezes cada conjunto de n palavras adjacentes dos sumários automáticos se repetem nos sumários humanos. Essa medida indica a informatividade dos sumários automáticos, sendo este critério um dos mais importantes na área. 5. Conclusões Neste trabalho, está se estudando um método que potencializa a eficiência da seleção de conteúdo para a SAM. Acredita-se que bons resultados podem ser gerados para a área de pesquisa. Esse trabalho possui a limitação de depender da catalogação prévia das relações CST. No entanto, trabalhos futuros poderão realizar essa tarefa de forma automática. Há sistemas disponíveis para isso, mas sua acurácia ainda é relativamente baixa, dada a subjetividade desse tipo de análise. Assim que o protótipo de SAM estiver com um funcionamento razoável, ele será disponibilizado para utilização pública. Agradecimentos Ao ICMC e à Pró-reitoria de Pesquisa, pelo apoio a este trabalho. Referências Bick, E. (2000). The Parsing System Palavras - Automatic Grammatical Analysis of Portuguese in a Constraint Grammar Framework. Aarhus: Aarhus University Press. Corpus for Single and Multi-Document Summarization of News Texts in Brazilian Portuguese. In the Proceedings of the RST Brazilian Meeting, pp Camargo, R. T. (2013). Investigação de estratégias de sumarização humana multidocumento. Dissertação de Mestrado. Universidade Federal de São Carlos. Karlsson, F.; Voutilainen, A.; Heikkila, J.; Anttila, A. (1995). Constraint Grammar - A Language-Independent System for Parsing Unrestricted Text. Mouton de Gruyter. Lin, C.Y. and Hovy, E. (2003). Automatic Evaluation of Summaries Using N-gram Cooccurrence Statistics. In the Proceedings of the Language Technology Conference, pp Mani, I. (2001). Automatic Summarization. John Benjamins Publishing Co. Amsterdam. Radev, D. R (2000). A common theory of information fusion from multiple text sources, step one: cross-document structure. In the Proceedings of the 1 st ACL Signal Workshop on Discourse and Dialogue, pp Souza, J.W.C. (2012). Investigação de métodos de identificação de redundância para Sumarização Multidocumento. Trabalho de Conclusão de Curso. Universidade Federal de São Carlos. Cardoso, P.C.F.; Castro Jorge, M.L.R; Seno, E.M.R., Di-Felippo, A; Rino, L.H.M; Nunes, M.G.V.; Pardo, T.A.S. (2011). A CSTNews A Discouse-Annotated

O Desenvolvimento de um Sistema Computacional de Sumarização Multidocumento com Base em um Método Linguisticamente Motivado

O Desenvolvimento de um Sistema Computacional de Sumarização Multidocumento com Base em um Método Linguisticamente Motivado O Desenvolvimento de um Sistema Computacional de Sumarização Multidocumento com Base em um Método Linguisticamente Motivado Guilherme Gonçalves, Thiago Alexandre Salgueiro Pardo Núcleo Interinstitucional

Leia mais

O Corpus CSTNews e sua Complementaridade Temporal

O Corpus CSTNews e sua Complementaridade Temporal O Corpus CSTNews e sua Complementaridade Temporal Jackson W. C. Souza 1,3, Ariani Di Felippo 2,3 1 Programa de Pós-graduação em Linguística e Língua Portuguesa (PPGL/UFSCar) 2 Departamento de Letras (DL)

Leia mais

ALINHAMENTO MANUAL DE TEXTOS E SUMÁRIOS EM UM CORPUS JORNALÍSTICO MULTIDOCUMENTO

ALINHAMENTO MANUAL DE TEXTOS E SUMÁRIOS EM UM CORPUS JORNALÍSTICO MULTIDOCUMENTO ALINHAMENTO MANUAL DE TEXTOS E SUMÁRIOS EM UM CORPUS JORNALÍSTICO MULTIDOCUMENTO 1. Introdução Com o imenso volume de informação disponível na web, necessita-se de estratégias que permitam absorvê-la de

Leia mais

COMPARANDO SUMÁRIOS DE REFERÊNCIA HUMANOS COM EXTRATOS IDEAIS NO PROCESSO DE AVALIAÇÃO DE SUMÁRIOS EXTRATIVOS

COMPARANDO SUMÁRIOS DE REFERÊNCIA HUMANOS COM EXTRATOS IDEAIS NO PROCESSO DE AVALIAÇÃO DE SUMÁRIOS EXTRATIVOS COMPARANDO SUMÁRIOS DE REFERÊNCIA HUMANOS COM EXTRATOS IDEAIS NO PROCESSO DE AVALIAÇÃO DE SUMÁRIOS EXTRATIVOS Carlos Henrique Delgado UBM Universidade de Barra mansa Barra Mansa Rio de Janeiro Brasil henrique_chd@yahoo.com.br

Leia mais

Alinhamento do CSTNews Processo, manual, tipos, exemplos, problemas

Alinhamento do CSTNews Processo, manual, tipos, exemplos, problemas Renata Tironi de Camargo (PPGL/NILC) Verônica Agostini (ICMC/NILC) Orientadores: Ariani Di Felippo Thiago A. S. Pardo 1 Alinhamento O que é, onde é usado, tipos Propostas de mestrado Alinhamento do CSTNews

Leia mais

DESENVOLVIMENTO DE UM PARSER DE CONECTORES TEXTUAIS E SUA APLICAÇÃO PARA ANÁLISE DE. Leonardo Zilio(Letras/UFRGS) Rodrigo Wilkens(PPG-Comp/UFRGS)

DESENVOLVIMENTO DE UM PARSER DE CONECTORES TEXTUAIS E SUA APLICAÇÃO PARA ANÁLISE DE. Leonardo Zilio(Letras/UFRGS) Rodrigo Wilkens(PPG-Comp/UFRGS) DESENVOLVIMENTO DE UM PARSER DE CONECTORES TEXTUAIS E SUA APLICAÇÃO PARA ANÁLISE DE GÊNEROS TEXTUAIS Leonardo Zilio(Letras/UFRGS) Rodrigo Wilkens(PPG-Comp/UFRGS) IX ELC Porto Alegre 08 de Outubro de 2010

Leia mais

TeMário 2006: Estendendo o Córpus TeMário

TeMário 2006: Estendendo o Córpus TeMário Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP TeMário 2006: Estendendo o Córpus TeMário Erick Galani Maziero Vinícius Rodrigues de Uzêda

Leia mais

Em Direção à Caracterização da Complementaridade no Corpus Multidocumento CSTNews

Em Direção à Caracterização da Complementaridade no Corpus Multidocumento CSTNews Em Direção à Caracterização da Complementaridade no Corpus Multidocumento CSTNews Jackson Souza 1,3, Ariani Di Felippo 1,2 1 Núcleo Interinstitucional de Linguística Computacional (NILC) Caixa Postal 668

Leia mais

Automatização de um Método de Avaliação de Estruturas Retóricas

Automatização de um Método de Avaliação de Estruturas Retóricas Automatização de um Método de Avaliação de Estruturas Retóricas Erick Galani Maziero (erickgm@grad.icmc.usp.br) Thiago Alexandre Salgueiro Pardo (taspardo@icmc.usp.br) Núcleo Interinstitucional de Lingüística

Leia mais

UNIVERSIDADE FEDERAL DE PERNAMBUCO CENTRO DE INFORMÁTICA GRADUAÇÃO EM ENGENHARIA DA COMPUTAÇÃO

UNIVERSIDADE FEDERAL DE PERNAMBUCO CENTRO DE INFORMÁTICA GRADUAÇÃO EM ENGENHARIA DA COMPUTAÇÃO UNIVERSIDADE FEDERAL DE PERNAMBUCO CENTRO DE INFORMÁTICA GRADUAÇÃO EM ENGENHARIA DA COMPUTAÇÃO Sistema de Sumarização Automática de Textos Baseado em Classes de Documentos PROPOSTA DE TRABALHO DE GRADUAÇÃO

Leia mais

Em Busca de Métodos de Detecção da Complementaridade para a Sumarização Automática Multidocumento

Em Busca de Métodos de Detecção da Complementaridade para a Sumarização Automática Multidocumento Em Busca de Métodos de Detecção da Complementaridade para a Sumarização Automática Multidocumento Jackson Wilke da Cruz Souza 1,2, Ariani Di Felippo 1,2 1 Núcleo Interinstitucional de Linguística Computacional

Leia mais

Enriquecendo o Córpus CSTNews a Criação de Novos Sumários Multidocumento

Enriquecendo o Córpus CSTNews a Criação de Novos Sumários Multidocumento Enriquecendo o Córpus CSTNews a Criação de Novos Sumários Multidocumento 1 Márcio S. Dias, 1 Alessandro Y. Bokan Garay, 2 Carla Chuman, 3 Cláudia D. Barros, 1 Erick G. Maziero, 1 Fernando A. A. Nobrega,

Leia mais

ELABORAÇÃO DE DICIONÁRIO ELETRÔNICO Mauro Rebello 1, Violeta de San Tiago Dantas Barbosa Quental 2.

ELABORAÇÃO DE DICIONÁRIO ELETRÔNICO Mauro Rebello 1, Violeta de San Tiago Dantas Barbosa Quental 2. DL - DEPARTAMENTO DE LETRAS ELABORAÇÃO DE DICIONÁRIO ELETRÔNICO Mauro Rebello 1, Violeta de San Tiago Dantas Barbosa Quental 2. 1 Aluno do curso de Letras da PUC-Rio 2 Professora e pesquisadora da área

Leia mais

Em Direção à Caracterização de Sumários Humanos Multidocumento

Em Direção à Caracterização de Sumários Humanos Multidocumento Em Direção à Caracterização de Sumários Humanos Multidocumento Renata Tironi de Camargo 1,2, Ariani Di Felippo 1,2, Thiago A. S. Pardo 2 1 Departamento de Letras (DL) Centro de Educação e Ciências Humanas

Leia mais

GistSumm GIST SUMMarizer: Extensões e Novas Funcionalidades

GistSumm GIST SUMMarizer: Extensões e Novas Funcionalidades Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP GistSumm GIST SUMMarizer: Extensões e Novas Funcionalidades Thiago Alexandre Salgueiro

Leia mais

PROTÓTIPO PARA SUMARIZAÇÃO AUTOMÁTICA DE TEXTOS ESCRITOS EM LÍNGUA PORTUGUESA ALEXANDRE BUSARELLO JOYCE MARTINS

PROTÓTIPO PARA SUMARIZAÇÃO AUTOMÁTICA DE TEXTOS ESCRITOS EM LÍNGUA PORTUGUESA ALEXANDRE BUSARELLO JOYCE MARTINS PROTÓTIPO PARA SUMARIZAÇÃO AUTOMÁTICA DE TEXTOS ESCRITOS EM LÍNGUA PORTUGUESA ALEXANDRE BUSARELLO JOYCE MARTINS Roteiro Introdução Objetivos Fundamentação Teórica Especificação Implementação Operacionalidade

Leia mais

Caracterização linguística de sumários humanos multidocumento: explorando o nível lexical

Caracterização linguística de sumários humanos multidocumento: explorando o nível lexical Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP Caracterização linguística de sumários humanos multidocumento: explorando o nível lexical

Leia mais

Análise Sintática de Frases utilizando Gramáticas Livres de Contexto Probabilísticas

Análise Sintática de Frases utilizando Gramáticas Livres de Contexto Probabilísticas Universidade de São Paulo Mestrado em Ciência da Computação Instituto de Matemática e Estatística Disciplina MAC5725 Lingüística Computacional Análise Sintática de Frases utilizando Gramáticas Livres de

Leia mais

Exploração de métodos de sumarização automática multidocumento com base em conhecimento semânticodiscursivo. Paula Christina Figueira Cardoso

Exploração de métodos de sumarização automática multidocumento com base em conhecimento semânticodiscursivo. Paula Christina Figueira Cardoso Exploração de métodos de sumarização automática multidocumento com base em conhecimento semânticodiscursivo Paula Christina Figueira Cardoso SERVIÇO DE PÓS-GRADUAÇÃO DO ICMC-USP Data de Depósito: Assinatura:

Leia mais

Fusão Automática de Sentenças Similares em Português

Fusão Automática de Sentenças Similares em Português Fusão Automática de Sentenças Similares em Português Eloize Rossi Marques Seno, Maria das Graças Volpe Nunes NILC ICMC Unisidade de São Paulo Caixa Postal 668 13560-970 São Carlos SP Brasil {eloize,gracan}@icmc.usp.br

Leia mais

6 Atributos. A dívida da empresa subiu.

6 Atributos. A dívida da empresa subiu. 6 Atributos Para buscar o sentimento de um texto automaticamente precisamos encontrar boas pistas ao longo do discurso. Uma grande variedade de palavras e expressões possui conotação positiva ou negativa,

Leia mais

Problemas de Escrita. Graça Nunes Thiago Pardo

Problemas de Escrita. Graça Nunes Thiago Pardo Problemas de Escrita Graça Nunes Thiago Pardo Qual é o problema? A transformada de Hough é um algoritmo muito conhecido em visão computacional, mas a sua aplicação em alguns sistemas de tempo real é proibitiva,

Leia mais

NEPaLE: Uma ferramenta computacional de suporte à avaliação de paráfrases

NEPaLE: Uma ferramenta computacional de suporte à avaliação de paráfrases NEPaLE: Uma ferramenta computacional de suporte à avaliação de paráfrases Rafael de Oliveira Teixeira 1, Eloize Rossi Marques Seno 1, Helena de Medeiros Caseli 2 1 Instituto Federal de São Paulo câmpus

Leia mais

Investigação de Métodos de Identificação de Redundância para a Sumarização Automática Multidocumento

Investigação de Métodos de Identificação de Redundância para a Sumarização Automática Multidocumento Investigação de Métodos de Identificação de Redundância para a Sumarização Automática Multidocumento Jackson Souza (jackcruzsouza@gmail.com) 01/08/2011 a 31/07/2012 Orientação: Profa. Dra. Ariani Di Felippo

Leia mais

SCC5908 Tópicos em Processamento de Língua Natural. Necessidade de lidar com grande quantidade de textos/documentos

SCC5908 Tópicos em Processamento de Língua Natural. Necessidade de lidar com grande quantidade de textos/documentos DISCURSO PARTE 3 SCC5908 Tópicos em Processamento de Língua Natural Thiago A. S. Pardo MUDANÇA DE PERSPECTIVA Web e explosão de informação Necessidade de lidar com grande quantidade de textos/documentos

Leia mais

Métodos para Sumarização Automática Multidocumento Usando Modelos Semântico-Discursivos

Métodos para Sumarização Automática Multidocumento Usando Modelos Semântico-Discursivos Métodos para Sumarização Automática Multidocumento Usando Modelos Semântico-Discursivos Paula C. F. Cardoso, Thiago A. S. Pardo, Maria das Graças V. Nunes Núcleo Interinstitucional de Linguística Computacional

Leia mais

Estratégias de Seleção de Conteúdo com Base na CST (Cross-document Structure Theory) para Sumarização Automática Multidocumento

Estratégias de Seleção de Conteúdo com Base na CST (Cross-document Structure Theory) para Sumarização Automática Multidocumento Estratégias de Seleção de Conteúdo com Base na CST (Cross-document Structure Theory) para Sumarização Automática Multidocumento Maria Lucia del Rosario Castro Jorge, Thiago Alexandre Salgueiro Pardo Núcleo

Leia mais

Geração de Modelo para Reconhecimento de Entidades Nomeadas no OpenNLP

Geração de Modelo para Reconhecimento de Entidades Nomeadas no OpenNLP Geração de Modelo para Reconhecimento de Entidades Nomeadas no OpenNLP Gabriel C. Chiele 1, Evandro Fonseca 1, Renata Vieira 1 1 Faculdade de Informática Pontifícia Universidade Católica do Rio Grande

Leia mais

EDITOR DE ANOTAÇÃO DE SIMPLIFICAÇÃO: MANUAL DO USUÁRIO

EDITOR DE ANOTAÇÃO DE SIMPLIFICAÇÃO: MANUAL DO USUÁRIO Universidade de São Paulo USP Universidade Federal de São Carlos UFSCar Universidade Estadual Paulista UNESP EDITOR DE ANOTAÇÃO DE SIMPLIFICAÇÃO: MANUAL DO USUÁRIO Helena de Medeiros Caseli Tiago de Freitas

Leia mais

Introdução ao Processamento de Línguas Naturais. Thiago A. S. Pardo

Introdução ao Processamento de Línguas Naturais. Thiago A. S. Pardo Introdução ao Processamento de Línguas Naturais Thiago A. S. Pardo Núcleo Interinstitucional de Lingüística Computacional Instituto de Ciências Matemáticas e de Computação Universidade de São Paulo 1 Meta

Leia mais

Pedro Paulo Balage Filho

Pedro Paulo Balage Filho Interface Web para o projeto: Sumarização Automática Multidocumento para o Português do Brasil com Base na Teoria de Estruturação Multidocumento CST (Cross-documentStructure Theory) Pedro Paulo Balage

Leia mais

O código do modelo de mapeamento sintático-conceitual do sistema ConPor

O código do modelo de mapeamento sintático-conceitual do sistema ConPor Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP O código do modelo de mapeamento sintático-conceitual do sistema ConPor Lucia Specia Lucia

Leia mais

Uma coleção de artigos científicos de Português compondo um Corpus no domínio educacional

Uma coleção de artigos científicos de Português compondo um Corpus no domínio educacional Uma coleção de artigos científicos de Português compondo um Corpus no domínio educacional LUÍS HENRIQUE G. DE AGUIAR Mestrando no Programa de Pós-graduação em Educação da Universidade Federal dos Vales

Leia mais

TeMário: Um Corpus para Sumarização Automática de Textos

TeMário: Um Corpus para Sumarização Automática de Textos Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP TeMário: Um Corpus para Sumarização Automática de Textos Thiago Alexandre Salgueiro Pardo

Leia mais

Recapitulando... Abordagens: PLN. Abordagens: PLN 29/03/2012. Introdução ao Processamento de Línguas Naturais. Distribuição de palavras

Recapitulando... Abordagens: PLN. Abordagens: PLN 29/03/2012. Introdução ao Processamento de Línguas Naturais. Distribuição de palavras Introdução ao Processamento de Línguas Naturais SCC5908 Introdução ao Processamento de Língua Natural Thiago A. S. Pardo Recapitulando... Abordagens superficiais vs. profundas Simbolismo vs. estatística

Leia mais

Identificação de Pontos Perceptualmente Importantes (PIP) em séries temporais de tópicos extraídos de dados textuais

Identificação de Pontos Perceptualmente Importantes (PIP) em séries temporais de tópicos extraídos de dados textuais Universidade de São Paulo Biblioteca Digital da Produção Intelectual - BDPI Departamento de Ciências de Computação - ICMC/SCC Comunicações em Eventos - ICMC/SCC 2015 Identificação de Pontos Perceptualmente

Leia mais

Tratamento dos Erros de Sintaxe. Adriano Maranhão

Tratamento dos Erros de Sintaxe. Adriano Maranhão Tratamento dos Erros de Sintaxe Adriano Maranhão Introdução Se um compilador tivesse que processar somente programas corretos, seu projeto e sua implementação seriam grandemente simplificados. Mas os programadores

Leia mais

Visualização de Texto e Documento

Visualização de Texto e Documento Visualização de Texto e Documento SCC5836 Visualização Computacional Prof. Fernando V. Paulovich http://www.icmc.usp.br/~paulovic paulovic@icmc.usp.br Instituto de Ciências Matemáticas e de Computação

Leia mais

O tratamento da partícula se para fins de anotação de papéis semânticos

O tratamento da partícula se para fins de anotação de papéis semânticos O tratamento da partícula se para fins de anotação de papéis semânticos Magali Sanches Duran, Sandra Maria Aluísio Núcleo Interinstitucional de Linguística Computacional ICMC Universidade de São Paulo

Leia mais

CP Compiladores I Prof. Msc.. Carlos de Salles

CP Compiladores I Prof. Msc.. Carlos de Salles CP 5017.9 Prof. Msc.. Carlos de Salles 1 - EMENTA O Processo de Compilação. Deteção e Recuperação de Erros. Introdução à geração de Código Intermediário. Geração de Código de Máquina. Otimização. Uma visão

Leia mais

UNIVERSIDADE DE SÃO PAULO Instituto de Ciências Matemáticas e de Computação ISSN

UNIVERSIDADE DE SÃO PAULO Instituto de Ciências Matemáticas e de Computação ISSN UNIVERSIDADE DE SÃO PAULO Instituto de Ciências Matemáticas e de Computação ISSN 0103-2569 IDENTIFICAÇÃO AUTOMÁTICA DE MACROASPECTOS EM TEXTOS JORNALÍSTICOS ALESSANDRO YOVAN BOKAN GARAY THIAGO ALEXANDRE

Leia mais

Uma ferramenta para expansão do vocabulário com base em coocorrência

Uma ferramenta para expansão do vocabulário com base em coocorrência Resumos Expandidos: XI Mostra de Estagiários e Bolsistas... 11 Uma ferramenta para expansão do vocabulário com base em coocorrência Exupério Lédo Silva Júnior 1 Roberta Akemi Sinoara 2 Solange Oliveira

Leia mais

Corretor Gramatical Para o Emacs

Corretor Gramatical Para o Emacs Trabalho de Conclusão de Curso Thiago Maciel batista Orientador: Prof. Dr. Marcelo Finger Instituto de Matemática e Estatística Universidade de São Paulo 16 de novembro de 2010 Roteiro 1 Introdução 2 Processamento

Leia mais

Extração de paráfrases em português a partir de léxicos bilíngues: um estudo de caso

Extração de paráfrases em português a partir de léxicos bilíngues: um estudo de caso Extração de paráfrases em português a partir de léxicos bilíngues: um estudo de caso Paulo César Polastri 1,2, Helena de Medeiros Caseli 1,2, Eloize Rossi Marques Seno 2,3 1 Departamento de Computação,

Leia mais

Sumarização Automática para Simplificação de Textos: Experimentos e Lições Aprendidas

Sumarização Automática para Simplificação de Textos: Experimentos e Lições Aprendidas Sumarização Automática para Simplificação de Textos: Experimentos e Lições Aprendidas Paulo R. A. Margarido, Thiago A. S. Pardo e Sandra M. Aluísio Núcleo Interinstitucional de Lingüística Computacional

Leia mais

Critérios para transcrição da fala espontânea

Critérios para transcrição da fala espontânea Critérios para transcrição da fala espontânea Heloísa Vale Heliana Mello Tommaso Raso UFMG Visão geral desta apresentação O corpus C-ORAL-BRASIL Originalidade e vantagens da transcrição Alguns fenômenos

Leia mais

Pesquisa Digital PATRICIA para Consultas a Banco de Dados em Linguagem Natural

Pesquisa Digital PATRICIA para Consultas a Banco de Dados em Linguagem Natural Pesquisa Digital PATRICIA para Consultas a Banco de Dados em Linguagem Natural Rodrigo Bonone Moreira 1, Alexandre de Oliveira Zamberlan 1 1 UNIFRA Centro Universitário Franciscano Curso de Ciência da

Leia mais

Compiladores. Eduardo Ferreira dos Santos. Fevereiro, Ciência da Computação Centro Universitário de Brasília UniCEUB 1 / 38

Compiladores. Eduardo Ferreira dos Santos. Fevereiro, Ciência da Computação Centro Universitário de Brasília UniCEUB 1 / 38 Compiladores Eduardo Ferreira dos Santos Ciência da Computação Centro Universitário de Brasília UniCEUB Fevereiro, 2017 1 / 38 Sumário 1 Compiladores 2 Linguagens de programação 3 Ciência dos compiladores

Leia mais

(2) A rápida publicação deste livro pela editora foi um bom negócio.

(2) A rápida publicação deste livro pela editora foi um bom negócio. 1 Introdução Esta dissertação tem o objetivo geral de investigar as formas nominalizadas deverbais no que tange ao seu aspecto polissêmico e multifuncional. O objetivo específico consiste em verificar,

Leia mais

Comparação dos algoritmos sequencial e paralelo para contagem de palavras e contexto

Comparação dos algoritmos sequencial e paralelo para contagem de palavras e contexto Comparação dos algoritmos sequencial e paralelo para contagem de palavras e contexto Eduardo Delazeri Ferreira, Francieli Zanon Boito, Aline Villavicencio 1. Introdução 1 Instituto de Informática - Universidade

Leia mais

Anotação de subtópicos do córpus multidocumento CSTNews

Anotação de subtópicos do córpus multidocumento CSTNews Núcleo Interinstitucional de Linguística Computacional - NILC Anotação de subtópicos do córpus multidocumento CSTNews Relatório Técnico NILC-TR-12-07 Paula C. F. Cardoso, Amanda P. Rassi, Erick G. Maziero,

Leia mais

Manual OntoLP. 1-Introdução ao OntoLP Instalação do OntoLP Executando o OntoLP Observação Importante...4

Manual OntoLP. 1-Introdução ao OntoLP Instalação do OntoLP Executando o OntoLP Observação Importante...4 Manual OntoLP Sumário: 1-Introdução ao OntoLP...2 2-Instalação do OntoLP...2 3-Executando o OntoLP...2 4-Observação Importante...4 5-Aba de Carga do Corpus...5 6-Aba de Extração de Termos...7 7- Aba de

Leia mais

Descrição de um Protótipo de Realização Superficial do Português

Descrição de um Protótipo de Realização Superficial do Português Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP Descrição de um Protótipo de Realização Superficial do Português Mauricio José Carvalho

Leia mais

Linguagens de Programação

Linguagens de Programação O estudante estuda muito. Regras: 7 9 12 14. . Regras: 2 4 . Regras: 1 Representar através de uma árvore de derivação. 77 O estudante estuda muito.

Leia mais

SUMARIZAÇÃO AUTOMÁTICA MULTIDOCUMENTO

SUMARIZAÇÃO AUTOMÁTICA MULTIDOCUMENTO SUMARIZAÇÃO AUTOMÁTICA MULTIDOCUMENTO Thiago A. S. Pardo Núcleo Interinstitucional de Lingüística Computacional Instituto de Ciências Matemáticas e de Computação Universidade de São Paulo SUMARIZAÇÃO MONODOCUMENTO

Leia mais

Todas as Palavras da Sentença como Métrica para um Sumarizador Automático

Todas as Palavras da Sentença como Métrica para um Sumarizador Automático Todas as Palavras da Sentença como Métrica para um Sumarizador Automático Marcus V. C. Guelpeli Departamento de Ciência da Computação Universidade Federal Fluminense - UFF mguelpeli@ic.uff.br Flavia Cristina

Leia mais

Implementação de um Modelo para Previsão de Evasão Escolar no IFSULDEMINAS

Implementação de um Modelo para Previsão de Evasão Escolar no IFSULDEMINAS 6ª Jornada Científica e Tecnológica e 3º Simpósio de Pós-Graduação do IFSULDEMINAS 04 e 05 de novembro de 2014, Pouso Alegre/MG Implementação de um Modelo para Previsão de Evasão Escolar no IFSULDEMINAS

Leia mais

4 Algoritmos de Aprendizado

4 Algoritmos de Aprendizado 4 Algoritmos de Aprendizado Este capítulo apresenta os algoritmos utilizados ao longo da dissertação e alguns utilizados como base por eles. Os algoritmos adotados são todos de aprendizado supervisionado.

Leia mais

Geração de perguntas e respostas para a base de conhecimento de um chatterbot educacional

Geração de perguntas e respostas para a base de conhecimento de um chatterbot educacional Proceedings of Symposium in Information and Human Language Technology. Uberlândia, MG, Brazil, October 2 5, 2017. c 2017 Sociedade Brasileira de Computação. Geração de perguntas e respostas para a base

Leia mais

INVESTIGAÇÃO DE ESTRATÉGIAS DE SUMARIZAÇÃO HUMANA MULTIDOCUMENTO. Renata Tironi de Camargo

INVESTIGAÇÃO DE ESTRATÉGIAS DE SUMARIZAÇÃO HUMANA MULTIDOCUMENTO. Renata Tironi de Camargo INVESTIGAÇÃO DE ESTRATÉGIAS DE SUMARIZAÇÃO HUMANA MULTIDOCUMENTO Renata Tironi de Camargo SÃO CARLOS 2013 UNIVERSIDADE FEDERAL DE SÃO CARLOS CENTRO DE EDUCAÇÃO E CIÊNCIAS HUMANAS PROGRAMA DE PÓS-GRADUAÇÃO

Leia mais

ANOTAÇÃO DE SENTIDOS DE VERBOS EM NOTÍCIAS JORNALÍSTICAS EM PORTUGUÊS DO BRASIL

ANOTAÇÃO DE SENTIDOS DE VERBOS EM NOTÍCIAS JORNALÍSTICAS EM PORTUGUÊS DO BRASIL ANOTAÇÃO DE SENTIDOS DE VERBOS EM NOTÍCIAS JORNALÍSTICAS EM PORTUGUÊS DO BRASIL 1 Marco A. Sobrevilla Cabezudo, 1 Erick G. Maziero, 2 Jackson W. C. Souza, 1 Márcio S. Dias, 1 Paula C. F. Cardoso, 1 Pedro

Leia mais

Autômatos e Linguagens

Autômatos e Linguagens Autômatos e Linguagens Eduardo Ferreira dos Santos Ciência da Computação Centro Universitário de Brasília UniCEUB Agosto, 2016 1 / 41 Sumário 1 Compiladores 2 Linguagens de programação 3 Ciência dos compiladores

Leia mais

Lucía Castro & Lucia Rino

Lucía Castro & Lucia Rino Lucía Castro & Lucia Rino Owczarzak, Karolina; Dang, Hoa Trang (2011). Who wrote What Where: Analyzing the content of human and automatic summaries. Proc. of the Workshop on Automatic Summarization for

Leia mais

Análise de Significância Estatística na Comparação entre Sistemas de Sumarização Automática

Análise de Significância Estatística na Comparação entre Sistemas de Sumarização Automática Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP Análise de Significância Estatística na Comparação entre Sistemas de Sumarização Automática

Leia mais

Indexação automática. CBD/ECA Indexação: teoria e prática

Indexação automática. CBD/ECA Indexação: teoria e prática Indexação automática CBD/ECA Indexação: teoria e prática Indexação documentária Identificar pela análise dos documentos, os seus assuntos extrair os conceitos que indicam o seu conteúdo traduzir os conceitos

Leia mais

Ferramenta de apoio a identificação de eventos utilizando Linguagem Natural. Aluno: Ricardo Tomelin Orientador: Everaldo Artur Grahl

Ferramenta de apoio a identificação de eventos utilizando Linguagem Natural. Aluno: Ricardo Tomelin Orientador: Everaldo Artur Grahl Ferramenta de apoio a identificação de eventos utilizando Linguagem Natural Aluno: Ricardo Tomelin Orientador: Everaldo Artur Grahl Roteiro 1. Introdução 2. Objetivos 3. Análise Essencial de Sistemas 4.

Leia mais

Desenvolvimento de Sistemas de Extração de Informações para Ambientes Colaborativos na Web

Desenvolvimento de Sistemas de Extração de Informações para Ambientes Colaborativos na Web Desenvolvimento de Sistemas de Extração de Informações para Ambientes Colaborativos na Web Douglas Nogueira 1, Vladia Pinheiro 2, Vasco Furtado 1, Tarcisio Pequeno 1 1 Mestrado em Informática Aplicada

Leia mais

A Floresta Sintá(c)tica como recurso Susana Afonso Projecto Floresta Sintá(c)tica

A Floresta Sintá(c)tica como recurso Susana Afonso Projecto Floresta Sintá(c)tica A Floresta Sintá(c)tica como recurso Susana Afonso Projecto Floresta Sintá(c)tica 1. Introdução O uso de recursos linguísticos parece ser hoje incontestavelmente uma prática cada vez mais necessária em

Leia mais

Desambiguação Lexical de Sentido com uso de Informação Multidocumento por meio de Redes de Co-ocorrência

Desambiguação Lexical de Sentido com uso de Informação Multidocumento por meio de Redes de Co-ocorrência Desambiguação Lexical de Sentido com uso de Informação Multidocumento por meio de Redes de Co-ocorrência Fernando Antônio A. Nóbrega, Thiago A. Salgueiro Pardo Núcleo Interinstitucional de Linguística

Leia mais

Análise Automática de Coerência Textual em Resumos Científicos: Avaliando Quebras de Linearidade

Análise Automática de Coerência Textual em Resumos Científicos: Avaliando Quebras de Linearidade Proceedings of Symposium in Information and Human Language Technology. Natal, RN, Brazil, November 4 7, 2015. c 2015 Sociedade Brasileira de Computação. Análise Automática de Coerência Textual em Resumos

Leia mais

BLMSumm Métodos de Busca Local e Metaheurísticas na Sumarização de Textos

BLMSumm Métodos de Busca Local e Metaheurísticas na Sumarização de Textos BLMSumm Métodos de Busca Local e Metaheurísticas na Sumarização de Textos Marcelo Arantes de Oliveira 1, Marcus Vinícius Guelpeli 2 1 Centro Universitário de Barra Mansa (UBM) Barra Mansa, RJ - Brasil

Leia mais

A/ART casa/n caiu/v./. Figura 3.1: Frase com anotação morfossintática.

A/ART casa/n caiu/v./. Figura 3.1: Frase com anotação morfossintática. 3 Tarefa Esse capítulo começa dissertando sobre as vantagens de se agrupar as palavras em classes, como elas são agrupadas em part-of-speechs e suas aplicações. Em seguida é apresentado o Anotador Morfossintático

Leia mais

Guião 1 Anexo (v1.0) 2. Do léxico à frase 2.1. Classes de palavras e critérios para a sua identificação

Guião 1 Anexo (v1.0) 2. Do léxico à frase 2.1. Classes de palavras e critérios para a sua identificação F a c u l d a d e d e L e t r a s d a U n i v e r s i d a d e d e L i s b o a D e p a r t a m e n t o d e L i n g u í s t i c a G e r a l e R o m â n i c a E s t r u t u r a d a s F r a s e s e m P o r

Leia mais

CSTNews: um Córpus de Textos Jornalísticos Anotados segundo a Teoria Discursiva Multidocumento CST (Cross-document Structure Theory)

CSTNews: um Córpus de Textos Jornalísticos Anotados segundo a Teoria Discursiva Multidocumento CST (Cross-document Structure Theory) Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP CSTNews: um Córpus de Textos Jornalísticos Anotados segundo a Teoria Discursiva Multidocumento

Leia mais

Semântica no Reconhecedor Gramatical Linguístico

Semântica no Reconhecedor Gramatical Linguístico Workshop de Tecnologias Adaptativas WTA 2015 Semântica no Reconhecedor Gramatical Linguístico Ana Contier, Djalma Padovani, João José Neto Linguagem Natural - Desafios Crescente quantidade de documentos

Leia mais

Geração Automática de Metadados

Geração Automática de Metadados Geração Automática de Metadados José David Fernández Curado Instituto de Matemática e Estatística - Universidade de São Paulo November 17, 2010 1 Introdução Motivação Metadados 2 Algoritmos de Geração

Leia mais

Conclusões. Baseado no Capítulo 9 de Programming Language Processors in Java, de Watt & Brown

Conclusões. Baseado no Capítulo 9 de Programming Language Processors in Java, de Watt & Brown Conclusões Baseado no Capítulo 9 de Programming Language Processors in Java, de Watt & Brown QUESTÕES FUNDAMENTAIS 1. Correção do código gerado 2. Desempenho do compilador: a. Notificação de erros; b.

Leia mais

Universidade do Sul de Santa Catarina Ciência da Computação Aula 09 Introdução a Análise de Textos Prof. Max Pereira

Universidade do Sul de Santa Catarina Ciência da Computação Aula 09 Introdução a Análise de Textos Prof. Max Pereira Universidade do Sul de Santa Catarina Ciência da Computação Técnicasde InteligênciaArtificial Aula 09 Introdução a Análise de Textos Prof. Max Pereira Processamento de Linguagem Natural Conjunto de técnicas

Leia mais

I-Preproc: uma ferramenta para pré-processamento e indexação incremental de documentos

I-Preproc: uma ferramenta para pré-processamento e indexação incremental de documentos 17 I-Preproc: uma ferramenta para pré-processamento e indexação incremental de documentos Renan Gomes Pereira 1 Maria Fernanda Moura 2 Resumo: O objetivo deste trabalho é apresentar a ferramenta I-Preproc,

Leia mais

Explorando Métodos de Uso Geral para Desambiguação Lexical de Sentidos para a Língua Portuguesa

Explorando Métodos de Uso Geral para Desambiguação Lexical de Sentidos para a Língua Portuguesa Explorando Métodos de Uso Geral para Desambiguação Lexical de Sentidos para a Língua Portuguesa Fernando Antônio A. Nóbrega 1, Thiago A. Salgueiro Pardo 1 1 Núcleo Interinstitucional de Linguística Computacional

Leia mais

Introdução ao Processamento de Línguas Naturais (PLN) SCC0230 Introdução à IA. Prof. Thiago A. S. Pardo. Em oposição às linguagens artificiais

Introdução ao Processamento de Línguas Naturais (PLN) SCC0230 Introdução à IA. Prof. Thiago A. S. Pardo. Em oposição às linguagens artificiais Introdução ao Processamento de Línguas Naturais () SCC0230 Introdução à IA Prof. Thiago A. S. Pardo 1 Língua Natural Língua humana Em oposição às linguagens artificiais Matemática, lógica, linguagens de

Leia mais

Avaliação do grau de concordância entre anotadores: análise e discussão dos resultados do processo de re-revisão

Avaliação do grau de concordância entre anotadores: análise e discussão dos resultados do processo de re-revisão Avaliação do grau de concordância entre anotadores: análise e discussão dos resultados do processo de re-revisão 1. Introdução Quando se produz um recurso a ser utilizado por diversos investigadores com

Leia mais

Prof. Lorí Viali, Dr.

Prof. Lorí Viali, Dr. Prof. Lorí Viali, Dr. viali@pucrs.br http://www.pucrs.br/famat/viali/ Dentre a grande variedade de sistemas que podem ser modelados e para os quais a simulação pode ser aplicada com proveito, uma classe

Leia mais

AULA 8 Experimentos multinomiais e tabelas de contingência

AULA 8 Experimentos multinomiais e tabelas de contingência 1 AULA 8 Experimentos multinomiais e tabelas de contingência Ernesto F. L. Amaral 05 de outubro de 2013 Centro de Pesquisas Quantitativas em Ciências Sociais (CPEQS) Faculdade de Filosofia e Ciências Humanas

Leia mais

Organizaçãoe Recuperaçãode Informação GSI521. Prof. Dr. Rodrigo Sanches Miani FACOM/UFU

Organizaçãoe Recuperaçãode Informação GSI521. Prof. Dr. Rodrigo Sanches Miani FACOM/UFU Organizaçãoe Recuperaçãode Informação GSI521 Prof. Dr. Rodrigo Sanches Miani FACOM/UFU Pré-processamento de documentos Organização e Recuperação de Informação(GSI521) Introdução O pré-processamento de

Leia mais

UNIVERSIDADE DE SÃO PAULO Instituto de Ciências Matemáticas e de Computação

UNIVERSIDADE DE SÃO PAULO Instituto de Ciências Matemáticas e de Computação UNIVERSIDADE DE SÃO PAULO Instituto de Ciências Matemáticas e de Computação Investigação de Mapas de Relacionamento para Sumarização Multidocumento Rafael Ribaldo Investigação de Mapas de Relacionamento

Leia mais

Aplicação de métodos clássicos de Sumarização Automática no contexto multidocumento multilíngue: primeiras aproximações

Aplicação de métodos clássicos de Sumarização Automática no contexto multidocumento multilíngue: primeiras aproximações Universidade de São Paulo - USP Universidade Federal de São Carlos UFSCar Universidade Estadual Paulista - UNESP Aplicação de métodos clássicos de Sumarização Automática no contexto multidocumento multilíngue:

Leia mais

Universidade de Santa Cruz do Sul UNISC Departamento de informática COMPILADORES. Introdução. Geovane Griesang

Universidade de Santa Cruz do Sul UNISC Departamento de informática COMPILADORES. Introdução. Geovane Griesang Universidade de Santa Cruz do Sul UNISC Departamento de informática COMPILADORES Introdução geovanegriesang@unisc.br Processadores de linguagem Linguagens de programação são notações para se descrever

Leia mais

I.2 Introdução a Teoria da Computação

I.2 Introdução a Teoria da Computação I.2 Introdução a Teoria da Computação O que é? Fundamento da Ciência da Computação Tratamento Matemático da Ciência da Computação Estudo Matemático da Transformação da Informação Qual sua importância?

Leia mais

Características de Sistemas de Arquivos Distribuídos Serviços de nomes e diretórios

Características de Sistemas de Arquivos Distribuídos Serviços de nomes e diretórios Características de Sistemas de Arquivos Distribuídos Serviços de nomes e diretórios Prof. Dr. Norian Marranghello Grupo 13 Guilherme Eberhart Jorge Marcelo Lima Macedo 1 - Sistema de arquivos distribuídos

Leia mais

Sumarização Automática: Principais Conceitos e Sistemas para o Português Brasileiro

Sumarização Automática: Principais Conceitos e Sistemas para o Português Brasileiro Universidade de São Paulo - USP Universidade Federal de São Carlos - UFSCar Universidade Estadual Paulista - UNESP Sumarização Automática: Principais Conceitos e Sistemas para o Português Brasileiro Thiago

Leia mais

UMA FERRAMENTA PARA A PESQUISA EM CORPORA DE AQUISIÇÃO DE LINGUAGEM

UMA FERRAMENTA PARA A PESQUISA EM CORPORA DE AQUISIÇÃO DE LINGUAGEM UMA FERRAMENTA PARA A PESQUISA EM CORPORA DE AQUISIÇÃO DE LINGUAGEM 1. INTRODUÇÃO Corpora de linguagem dirigida a e produzida por crianças são recursos valiosos para estudos de aquisição da linguagem,

Leia mais

24/09/2010 SINTAXE PARTE 2. SCC5869 Tópicos em Processamento de Língua Natural. Thiago A. S. Pardo PARSING PROBABILÍSTICO

24/09/2010 SINTAXE PARTE 2. SCC5869 Tópicos em Processamento de Língua Natural. Thiago A. S. Pardo PARSING PROBABILÍSTICO SINTAXE PARTE 2 SCC5869 Tópicos em Processamento de Língua Natural Thiago A. S. Pardo PARSING PROBABILÍSTICO 1 ESTATÍSTICA Métodos anteriores são eficientes, mas não têm mecanismos para escolher uma das

Leia mais

AMBIENTE DIDÁTICO GRÁFICO PARA A COMPREENSÃO DE LÓGICA DE PROGRAMAÇÃO. Rodrigo Ferreira da Silva

AMBIENTE DIDÁTICO GRÁFICO PARA A COMPREENSÃO DE LÓGICA DE PROGRAMAÇÃO. Rodrigo Ferreira da Silva AMBIENTE DIDÁTICO GRÁFICO PARA A COMPREENSÃO DE LÓGICA DE PROGRAMAÇÃO Rodrigo Ferreira da Silva rodrigoferreira2002@hotmail.com Klaus Schlünzen Junior klaus@prudente.unesp.br Universidade Estadual Paulista

Leia mais

4 A sumarização automática

4 A sumarização automática 4 A sumarização automática Para nos referirmos à sumarização automática, devemos situar a área da Linguística Computacional (LC) e seu campo de estudo. A LC vem desenvolvendo ou discutindo teorias sobre

Leia mais

SEMÂNTICA PARTE 3 ANÁLISE SEMÂNTICA 14/06/2012. SCC5908 Tópicos em Processamento de Língua Natural. Até agora, significado da sentença

SEMÂNTICA PARTE 3 ANÁLISE SEMÂNTICA 14/06/2012. SCC5908 Tópicos em Processamento de Língua Natural. Até agora, significado da sentença SEMÂNTICA PARTE 3 SCC5908 Tópicos em Processamento de Língua Natural Thiago A. S. Pardo ANÁLISE SEMÂNTICA Até agora, significado da sentença Rhumba closed. e Closing(e) Closed(e,Rhumba) 2 1 ANÁLISE SEMÂNTICA

Leia mais

1 Introdução. 1.1.Motivação

1 Introdução. 1.1.Motivação 1 Introdução O objetivo deste capítulo é estabelecer o contexto da pesquisa realizada neste trabalho. Ao longo deste capítulo serão apresentadas: a motivação para a pesquisa, os objetivos do trabalho,

Leia mais

Universidade Federal de Alfenas

Universidade Federal de Alfenas Universidade Federal de Alfenas Linguagens Formais e Autômatos Aula 12 Linguagens Livres do Contexto humberto@bcc.unifal-mg.edu.br Linguagens Livres do Contexto Para as LLC, temos as Gramáticas Livres

Leia mais