Mostrar mensagens com a etiqueta Informação e Documento. Mostrar todas as mensagens
Mostrar mensagens com a etiqueta Informação e Documento. Mostrar todas as mensagens

quarta-feira, 26 de outubro de 2011

INTRODUÇÃO À INFORMAÇÃO

Recuperação de informação em documentos XML

Desde 2000, quando aconteceu o primeiro workshop sobre XML e Recuperação de Informação,

este tema tem estado presente nas conferências ACM SIGIR, mostrando o interesse da comunidade de

Recuperação de Informação em explorar melhor as informações semi-estruturadas, dando a estas um

enfoque de RI, em contrapartida ao enfoque de Banco de Dados que sempre receberam. Esta abordagem é

importante para estender o papel do XML além do objetivo de troca de dados na Web , tornando-o

interessante para troca de informação, dentro de toda a flexibilidade e liberdade que caracterizam a Web.

Em 2002, na Finlândia, durante o 2° workshop sobre o tema, debates sobre o sentido da

recuperação de documentos XML, levaram a conclusão de que é importante trata-la desvinculada de

operações de Banco de Dados.

Tendo estudado a Web Semântica anteriormente, e concluído ser uma proposta ambiciosa demais

para a diversidade da Web e pouco disseminada até o momento, optamos por recuar um passo atrás e

estudar de que forma as informações semi-estruturadas, e mais especificamente o XML, podem contribuir

para melhorar a precisão e revocação das máquinas de busca. Fomos motivados pelo entendimento de que

as
tags ajudam a definir o significado dos termos que delimitam, podendo, conseqüentemente, contribuir

para a precisão dos resultados de uma pesquisa.

Com este objetivo, os principais artigos encontrados sobre o assunto foram estudados e

comparados, permitindo algumas conclusões que servirão de base para a escolha de futuros caminhos.

Apresentaremos um breve apanhado de cada um dos artigos abordando suas características mais

marcantes, os principais avanços e limitações, seguido de um quadro comparativo. E fechando o presente

trabalho apresentaremos nossas conclusões e uma proposta para trabalhos futuros.

Artigo [1] - Searching Text-rich XML Documents with Relevance Ranking

Assumindo o compromisso de utilizar o máximo possível as técnicas convencionais de

Recuperação de Informação, seu principal objetivo é permitir a recuperação de documentos XML

ordenados por relevância, em contraposição às diversas linguagem que tratam apenas as pesquisas

exatas. As consultas serão genéricas, e os resultados não serão exatos, permitindo a ordenação por

relevância, calculada a partir do grau de similaridade entre a consulta e o documento.

O Artigo considera intratável a recuperação de documentos XML com estruturas arbitrárias e

impõe restrições aos tipos de sub-estruturas dos documentos que poderão ser especificadas na consulta. É

definido o conceito de “campos de pesquisa “ mapeados em sub-estruturas dos documentos.A partir

dessa decisão de projeto, somente sub-estruturas especificas, chamadas de
tag-path, poderão ser

apontadas por uma consulta.

Os trechos em negrito na figura 1.0 correspondem a
tag-paths.

Fig 1.0

Os princípios básicos do projeto são:

·
O sistema indexa e pesquisa documentos XML bem-formados, sem considerar as DTDs;

·
Um número finito de sub-estruturas pesquisáveis serão definidas previamente à indexação . A

associação entre campos de pesquisas e
tag-paths será definida em um arquivo chamado Format

File;

·
O indexador verifica o Format File e cria um arquivo para cada “campo de pesquisa”;

·
Um serviço de aplicação deverá formular uma consulta aceitável pela máquina de busca a partir da

informação requisitada pelo usuário. Para isso, este serviço deverá conhecer os “campos de

pesquisa“ e sua associação semântica com as sub -estruturas dos documentos XML.

A implementação da máquina de busca possui a arquitetura mostrada na figura 2.0 , cujos módulos

funcionais detalhamos a seguir:

Fig 2.0

Format File
- Este arquivo destina-se a definir os índices que serão criados para um conjunto de

documentos da coleção. Em sua estrutura ele traz o nome e o formato dos arquivos de índices, as

associações entre
tag-paths e “campos de pesquisas” e a localização de processadores específicos para o

idioma dos documentos.

Indexer –
É o módulo responsável pela interpretação do Format File e posterior criação dos índices nele

definidos. Os termos contidos em cada campo de um documentos receberão pesos utilizando a fórmula

tradicional de TFxIDF. Neste módulo ocorrerá a leitura, extração dos termos e o cálculo de seus pesos .

Query Engine -
A máquina de pesquisa foi implementada acrescentando-se extensões a uma máquina de

busca de texto já existente. Ela permite a busca por termos ou
tags.

Aplication Service
– É o módulo responsável pela interpretação da estrutura da consulta proposta pelo

usuário, para identificar o “campo de pesquisa” e o respectivo arquivo de índice.

Não há esclarecimentos sobre como o Format File será criado, nem como consultas sem indicação

de sub-estrutura serão tratadas. Os resultados apresentados referem-se apenas ao tempo de processamento

necessário à geração dos índices e ao tamanho dos mesmos, mas nenhuma análise sobre a precisão dos

resultados é apresentada.

A grande limitação desta proposta é a pré-definição da estrutura dos índices através dos Format

Files, diminuindo a flexibilidade das pesquisas, mas representa a primeira tentativa de explorar a estrutura

XML em benefício da recuperação de informação.

Artigo [2] – Generating Vector Spaces On-the-fly for Flexible XML Retrieval

O foco dessa proposta é criar mecanismos que permitam ao usuário de uma máquina de busca

compor consultas que explorem a estrutura dos documentos XML, obtendo resultados ordenados por

relevância de acordo com uma granularidade desejada. Em busca deste objetivo, rompe as barreiras da

máquina de busca tradicional que enxergam os documentos de forma plana e também as limitações das

linguagens de consulta de XML que efetuam basicamente pesquisas exatas.

A ordenação por relevância leva em conta a estrutura do documento e as restrições que a consulta

impõe sobre esta estrutura. Mais especificamente, os conteúdos em diferentes níveis da árvore que

representam o documento terão importância diferente para consultas diferentes. Os autores utilizam a

idéia de Fuhr [4] que introduz pesos chamados de
augmentation weights atribuídos a estatísticas como

TFxIDF de cada termo, conforme a sua posição na árvore. Os elementos presentes na estrutura de cada

documento são agrupados em nós de indexação que implementam as listas invertidas (vide fig 3.0)

Fig 3.0

As consultas são agrupadas em três tipos diferentes, conforme o escopo da árvore que pretendem

abranger:

Single_category
– consultas que buscam termos em apenas uma sub-árvore. Por exemplo consultas

interessada apenas em livros de medicina, na arvore mostrada na fig 3.

Multi-category
– consultas que buscam termos em mais de uma sub-árvore. Por exemplo consultas

interessadas em livros sobre medicina e biologia.

Nested- category
– consultas que buscam termos em toda uma sub-árvore mas cujos elementos possuem

diferentes relevâncias para uma mesma consulta. Por exemplo o elemento título e parágrafo no exemplo.

(a presença de um termo no título certamente será mais relevante que a presença do mesmo termo num

parágrafo.)

Para cada uma das três categorias de consulta os termos terão pesos diferentes, dependendo da

estrutura da consulta. Estes pesos deverão ser calculados dinamicamente a partir de um índice básico précalculado.

Os índice básicos serão criados para cada elemento da árvore que possuem conteúdo textual ,

sendo que o artigo não detalha como isso ocorrerá, mas apenas sugere que poderão ser criados a partir de

técnicas padrões de RI como extração de termos e eliminação de
stop words. Partindo destes índices

básicos ,cada tipo de consulta terá uma fórmula especifica obtidas a partir do Modelo Vetorial.

Eq.1.0 – Single-category

Eq. 2.0 - Multi-category

Eq. 3.0 – Nested_category

Em todas as equações observa-se que as estatísticas são calculadas para cada elemento na estrutura

do documento e não para cada documento, como na fórmula original do Modelo Vetorial. Na equação 2.0

a freqüência do elemento na coleção será a somatória da freqüência do elemento nas diversas categorias

abrangidas pela consulta (
ief mcat). Para a consulta aninhada (equação 3.0) a relevância será a soma

ponderada da relevância para uma categoria simples, onde os pesos serão os
augmentation weights

O grande avanço deste artigo é a flexibilidade admitida no processo de indexação, criando índices

específicos para cada documento sem restrições em sua estrutura. Em contrapartida o processamento da

consulta torna-se mais demorado tendo em vista a maior complexidade das fórmulas especialmente para

consultas em multi-categorias e categorias aninhadas.

A intenção de tratar diferentes granularidades de consulta, por outro lado, exigem do usuário um

conhecimento da estrutura do documento ou a sua dedução. Não há a possibilidade de uma busca

integrada em documentos XML ou não, uma vez que os índices trazem estatísticas a nível de elemento e

não de documento. Destina-se portanto, exclusivamente à recuperação de informação em documentos

XML.

Artigo [3] – An Extension of the Vector Space Model for Querying XML Documents via XML

Fragments

Esta proposta busca criar uma ferramenta de pesquisa mais amigável, onde usuários possam

expressar suas consultas na forma de texto livre ou através de consultas mais complexas dependendo do

conhecimento que possuem das DTDs. O resultado também será ordenado por relevância colocando no

topo do
ranking documentos cuja estrutura mais se aproxime daquela proposta na consulta.

O
ranking será gerado a partir de uma extensão do modelo vetorial que utilizará como unidades de

indexação não apenas termos, mas pares da forma
(ti,ci), onde os termos serão qualificados pelo contexto

onde aparecem. Na equação 4.0, o peso de termos individuais será substituído pelo peso dentro de uma

contexto,
wd(t,c). Mas além disso o modelo vetorial deixa de ter dimensões ortogonais entre t e c,

passando a considerar diferentes níveis de semelhança entre os contexto da consulta e do documento,

representada pelo fator
cr(ci,ck), conforme equação 5.0.

RVS(q,d) =
å wq(ti)*wd(ti)/ |Q|*|D| Eq. 4.0

RVS(q,d) =
åci åck wq(ti,ci)*wd(ti,ck)*cr(ci,ck)/ |Q|*|D| Eq. 5.0

Durante a indexação os documentos XML serão percorridos e um vetor de pares
(t,c) será extraído

para criar o perfil de cada documento. Armazenando os termos e seus contextos, a lista invertida do

termo
t, contendo todos os documentos onde t aparece, será divida em diversas listas, uma para cada

contexto, permitindo assim a recuperação do termo em determinado contexto. A estrutura dos

indexadores armazenará
t e c como uma única chave t#c e no momento da recuperação o sistema poderá

identificar ocorrências precisas de
t dentro de um contexto c. Poderá, também, recuperar todos os

contextos onde
t aparece fazendo uma junção de todas as listas através do sufixo t#. As consultas poderão

ser formuladas contendo os termos dentro de contextos ou apenas termos, como numa máquina de busca

tradicional, ou poderá também conter uma mistura das duas situações, como por ex:

XML tutorial <title><article> relating to XPath XQquery.</p><p> </p></font><p></p></font><p></p></b><p><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Gerando o seguinte conjunto </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">(t,c) , </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">para pesquisa:</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">{(xml,article/title), (tutorial, article/title), (relating, null), (Xpath, null), (XQuery, null)}</p><p> </p></font><p></p></font><p></p></b><p><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">O Algoritmo de ordenação levará em conta o peso do termo no contexto, bem como a semelhança</p><p> </p><p align="LEFT">entre os contextos.O Cálculo de </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">wd(t,c) </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">é trivial e utiliza as estatísticas da chave </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">t#c </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">, </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">t#c’</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">, etc. Para o</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">cálculo de </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">cr </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">foram definidos alguns critérios e para cada um foi criado um fator. Observe o efeito de</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">cada um deles para a consulta </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">Q=/book/chapter/title</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">:</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">LCS(Q,A)</p></font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT"></p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">: Longest Common Subsequence - Maior seqüência comum entre os contextos Q e A</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">A </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">LCS </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">POS GAPS LD CR</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">media/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/chapter/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">3 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">3 0 2 0.84</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">media/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">chapter/book/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">2 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">3 0 3 0.53</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">media/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">title/chapter/book/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">1 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">2 0 4 0.29</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">magazine/volume/article/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">1 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">4 0 4 0.19</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">POS(Q,A): </p></font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT"></p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">Average Optimal Position – Posição média ótima</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">A LCS </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">POS </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">GAPS LD CR</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/chapter/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">subtitle/number 3 </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">2 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">0 2 0.92</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">media/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/chapter/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number 3 </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">3 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">0 2 0.84</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">media/catolog/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/chapter/title </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">3 </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">4 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">0 2 0.75</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">GAPS(Q,A)</p></font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT"></p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">: Número de saltos existentes entre os elementos comuns aos contextos Q e A</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">A LCS POS </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">GAPS </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">LD CR</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Media/catalog /</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/chapter/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">subtitle</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number 3 4 </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">0 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">4 0.78</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">catolog/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">chapters</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">/chapter/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">section</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">numbe</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">r</p><p> </p><p align="LEFT">3 4 </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">2 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">4 0.68</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">LD(Q,A): </p></font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT"></p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">Length Difference – diferença de tamanho entre os contextos Q e A</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">A LCS POS GAPS </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">LD </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">CR</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">/</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">book/chapter/title/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">subtitle</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">subtitle</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">/</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">number/bulle</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">t</p><p> </p><p align="LEFT">3 2 0 </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">4 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">0.88</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">book/chapter/title/</p></font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT"></p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">subtitle 3 2 0 </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">1 </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">0.95</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">A fórmula final de </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">cr </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">é dada por: </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">cr(Q,A) = </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Symbol"><font size="3" face="Symbol">a</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">LCS(Q,A) + </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Symbol"><font size="3" face="Symbol">b</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">POS(Q,A) - ?GAPS(Q,A) – dLD(Q,A)</font></font></b></p><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"> </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Cujos valores poderão variar entre 0 e 1.</p><p> </p></font><p></p></font><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Os documentos recuperados serão mostradas de forma semelhante a uma máquina de busca</p><p> </p><p align="LEFT">tradicional exceto pelo fato de permitir ao usuário a escolha de elementos dos documento que deseja</p><p> </p><p align="LEFT">mostrar no ranking.</p><p> </p><p align="LEFT">O artigo também não apresenta curvas de precisão e revocação, apesar de ter utilizado a coleção</p><p> </p><p align="LEFT">INEX [http//qmir.dcs.qmw.ac.uk/inex] para testes.</p><p> </p><p align="LEFT">Constata-se aqui um avanço ao permitir que sejam pesquisados documentos XML ou não. Há um</p><p> </p><p align="LEFT">tratamento dinâmico da semelhança entre os diversos contextos. Mas para que a estrutura dos documentos</p><p> </p><p align="LEFT">possam contribuir para a ordenação, as consultas deverão informar os elementos desejados, caso</p><p> </p><p align="LEFT">contrário todas as listas de um termo, em todos os contextos, serão aglutinadas constituindo-se assim um</p><p> </p><p align="LEFT">caso especial de consulta do Modelo Vetorial tradicional. Ou seja, a estrutura do documento não é</p><p> </p><p align="LEFT">avaliada para contribuir para a ordenação dos documentos a menos que o usuário tenha uma noção da</p><p> </p><p align="LEFT">estrutura dos mesmos e resolva explorar isso na formulação da consulta.</p><p> </p></font><p></p></font><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">Conclusão</p><p> </p></font><p></p></font><p></p></b><p><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Concluindo o trabalho apresentamos abaixo um quadro comparativo das três propostas,</p><p> </p><p align="LEFT">enfatizando aspectos de funcionalidade de cada um:</p><p> </p></font><p></p></font><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">Item Artigo [1] Artigo[2] Artigo[3]</p><p> </p></font><p></p></font><p></p></b><p><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Usuário deve conhecer a</p><p> </p><p align="LEFT">estrutura dos documentos</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Há restrição na estrutura dos</p><p> </p><p align="LEFT">Documentos</p><p> </p><p align="LEFT">Sim</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Pesquisa documentos não XML</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Sim</p><p> </p><p align="LEFT">Ordenação por relevância</p><p> </p><p align="LEFT">Sim</p><p> </p><p align="LEFT">Sim</p><p> </p><p align="LEFT">Sim</p><p> </p><p align="LEFT">Explora a estrutura do</p><p> </p><p align="LEFT">documento independente da</p><p> </p><p align="LEFT">consulta</p><p> </p><p align="LEFT">Sim</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Não</p><p> </p><p align="LEFT">Observamos que todas ordenam os documentos por relevância, ou seja, propiciam a busca</p><p> </p><p align="LEFT">aproximada, enquadrando-se como uma alternativa para as linguagens que trabalham apenas com busca</p><p> </p><p align="LEFT">exata.</p><p> </p><p align="LEFT">A primeira proposta restringe a estrutura dos documentos da coleção àquela prevista no Format</p><p> </p><p align="LEFT">File, já as outras duas alternativas trabalham amplamente com qualquer estrutura de documento da</p><p> </p><p align="LEFT">coleção.</p><p> </p><p align="LEFT">A proposta 3 permitem a busca em documentos não XML podendo, portanto, ser implementadas</p><p> </p><p align="LEFT">em máquinas de busca de uso geral.</p><p> </p><p align="LEFT">Nenhuma das alternativas exige que o usuário conheça a estrutura do documento. A primeira</p><p> </p><p align="LEFT">identifica os campos de pesquisa a partir da requisição do usuário, no módulo Serviço de Aplicação. Nas</p><p> </p><p align="LEFT">demais alternativas, caso o usuário não insira elementos da estrutura dos documentos na formulação da</p><p> </p><p align="LEFT">consulta a pesquisa recaíra no Modelo Vetorial tradicional.</p><p> </p></font><p></p></font><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">Trabalhos futuros</p><p> </p></font><p></p></font><p></p></b><p><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Estudando as três alternativas e observando os aspectos de funcionalidade que seriam desejáveis</p><p> </p><p align="LEFT">em uma máquina de busca para documentos XML, consideramos que uma ferramenta com este propósito</p><p> </p><p align="LEFT">deveria explorar a estrutura dos documentos independente de estar explícito na formulação da consulta ,</p><p> </p><p align="LEFT">ou seja, explorar esta estrutura como uma fonte adicional de evidência, sem exigir do usuário qualquer</p><p> </p><p align="LEFT">noção sobre a mesma.</p><p> </p><p align="LEFT">Analisando o problema , dividimos o universo de busca em três componentes básicos:</p><p> </p><p align="LEFT">O termo (</p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">t</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">), o elemento (</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">e</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">) e o documento (</font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">d</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">). A partir daí podemos seguir três linhas básica:</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font><font size="3" face="Symbol"><font size="3" face="Symbol"></font></font></p><font size="3" face="Symbol"><font size="3" face="Symbol"><p align="LEFT">· </p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">Combinamos termos e elementos, e calculamos TF e IDF sobre esta combinação como-se os</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">termos do Modelo Vetorial fossem na verdade um termo composto, t#c;</p><p> </p></font><p></p></font><p><font size="3" face="Symbol"><font size="3" face="Symbol"></font></font></p><font size="3" face="Symbol"><font size="3" face="Symbol"><p align="LEFT">· </p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">Consideramos o elemento como uma subdivisão do documento e calculamos as estatísticas do</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">Modelo Vetorial sobre o elemento, ao invés de trata-la sobre o documento;</p><p> </p></font><p></p></font><p><font size="3" face="Symbol"><font size="3" face="Symbol"></font></font></p><font size="3" face="Symbol"><font size="3" face="Symbol"><p align="LEFT">· </p></font><p align="LEFT"></p></font><p align="LEFT"><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">Combinarmos as duas opções anteriores, e trabalharmos com todas as estatísticas envolvendo </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">t </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">, </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">e</font></font></b></p><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"> </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">e </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">d.</font></font></b></p><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"> </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">No primeiro caso o </p></font><p align="LEFT"></p></font><p align="LEFT"><i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic">ranking </font></font></i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">de um documento será dado pela somatória das contribuições de cada</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">contexto onde os termos da pesquisa aparecem.</p><p> </p><p align="LEFT">No segundo caso o </p></font><p align="LEFT"></p></font><p align="LEFT"><i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic">ranking </font></font></i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">de um documento será dado pela somatória dos </font></font><i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic">rankings </font></font></i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">de cada</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">elemento. Documentos com elementos raros na coleção e documentos com elementos onde o termo</p><p> </p><p align="LEFT">aparece com maior freqüência terão maior </p></font><p align="LEFT"></p></font><p align="LEFT"><i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic">ranking. </font></font></i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">Mas documentos com maior número de elementos</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">contendo os termos da pesquisa também serão favorecidos.</p><p> </p><p align="LEFT">As propostas anteriores assemelham-se ao terceiro e segundo artigo respectivamente, exceto pelo</p><p> </p><p align="LEFT">fato de trabalhar sem a especificação de contexto na consulta.</p><p> </p><p align="LEFT">No terceiro caso </p></font><p align="LEFT"></p></font><p align="LEFT"><i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic">o ranking </font></font></i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">de um documento será dado pela somatória da contribuição de cada</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">termo, que levará em conta a freqüência de cada termo nos elementos, de cada elemento nos documentos,</p><p> </p><p align="LEFT">e também da freqüência dos elementos na coleção e dos documentos que contem os elementos na coleção.</p><p> </p><p align="LEFT">Casos especiais onde termos e elementos só aparecem juntos deverão ser favorecidos no </p></font><p align="LEFT"></p></font><p align="LEFT"><i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic">ranking</font></font></i><font size="3" face="Times-Italic"><font size="3" face="Times-Italic"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">,</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">caracterizando um acréscimo de semântica ao termo, devido a um contexto bem definido.</p><p> </p><p align="LEFT">Acreditamos que uma formulação correta das estatísticas envolvendo </p></font><p align="LEFT"></p></font><p align="LEFT"><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">t</font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">, </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">e </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">e </font></font><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold">d </font></font></b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman">poderão levar a</font></font></p><p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"> </font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">resultados interessantes, sem a necessidade de especificação de contexto pelo usuário, como acontece</p><p> </p><p align="LEFT">nas três propostas apresentadas.</p><p> </p></font><p></p></font><p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font></b></p><b><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"><p align="LEFT">Referências</p><p> </p></font><p></p></font><p></p></b><p><font size="3" face="Times-Bold"><font size="3" face="Times-Bold"></font></font><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"></font></font></p><font size="3" face="Times-Roman"><font size="3" face="Times-Roman"><p align="LEFT">[1] Y. Hayashi, J. Tomita e G. Kikul, “Searching Text -rich XML Documents with Relevance Ranking”,</p><p> </p><p align="LEFT">ACM SIGIR 2000 Workshop on XML and Information Retrieval, Atenas, Grécia , 28 de Julho de 2000 .</p><p> </p><p align="LEFT">[2]T. Grabs e H. J. Schek, “Generating Vector Spaces On -the-fly for Flexible XML Retrieval”, ACM</p><p> </p><p align="LEFT">SIGIR 2002 Workshop on XML and Information Retrieval, Tampere, Finlândia, Agosto 2002.</p><p> </p><p align="LEFT">[3] D. Carmel, N. Efraty, G. Landau, Y. Maarek e Y. Mass, “An Extension of the Vector Space Model for</p><p> </p><p align="LEFT">Querying XML Documents via XML Fragments”, ACM SIGIR 2002 Whorkshop on XML and</p><p> </p><p align="LEFT">Information Retrieval, Tampere, Finlândia, Agosto de 2002.</p><p> </p><p align="LEFT">[4] N. Fuhr e K. Grojohann. “XIRQL: A Query Language for Information Retrieval in XML documents”,</p><p> </p><p align="LEFT">ACM SIGIR Conference on Research and Development in Information Retrieval, páginas 172-180 ACM</p><p> </p><p>Press , 2001.</p></font></font></DIV></body>

INTRODUÇÃO `A ARQUIVOLOGIA

Informação e documentação - Citações

em documentos - Apresentação

Origem: Projeto NBR 10520:2002

ABNT/CB-14 - Comitê Brasileiro de Finanças, Bancos, Seguros, Comércio,

Administração e Documentação

CE-14:001.01 - Comissão de Estudo de Documentação

NBR 10520 - Information and documentation - Presentation of citations

Descriptors: Documentation. Citation

Esta Norma foi baseada na ISO 690:1987

Esta Norma substitui a NBR 10520:2001

Válida a partir de 29.09.2002

Palavras-chave: Documentação. Citação 7 páginas

Sumário

Prefácio

1 Objetivo

2 Referências normativas

3 Definições

4 Localização

5 Regras gerais de apresentação

6 Sistema de chamada

7 Notas de rodapé

Prefácio

A Associação Brasileira de Normas Técnicas (ABNT) é o Fórum Nacional de Normalização. As Normas Brasileiras, cujo

conteúdo é de responsabilidade dos Comitês Brasileiros (ABNT/CB) e dos Organismos de Normalização Setorial

(ABNT/ONS), são elaboradas por Comissões de Estudo (CE), formadas por representantes dos setores envolvidos, delas

fazendo parte: produtores, consumidores e neutros (universidades, laboratórios e outros).

Os Projetos de Norma Brasileira, elaborados no âmbito dos ABNT/CB e ABNT/ONS, circulam para Consulta Pública entre

os associados da ABNT e demais interessados.

1 Objetivo

Esta Norma especifica as características exigíveis para apresentação de citações em documentos.

2 Referências normativas

As normas relacionadas a seguir contêm disposições que, ao serem citadas neste texto, constituem prescrições para esta

Norma. As edições indicadas estavam em vigor no momento desta publicação. Como toda norma está sujeita à revisão,

recomenda-se àqueles que realizam acordos com base nesta que verifiquem a conveniência de se usarem as edições

mais recentes das normas citadas a seguir. A ABNT possui a informação das normas em vigor em um dado momento.

NBR 6023:2002 - Informação e documentação - Referências - Elaboração

NBR 10522:1988 - Abreviação na descrição bibliográfica - Procedimento

3 Definições

Para os efeitos desta Norma, aplicam-se as seguintes definições:

3.1 citação
: Menção de uma informação extraída de outra fonte.

3.2 citação de citação
: Citação direta ou indireta de um texto em que não se teve acesso ao original.

2 NBR 10520:2002

3.3 citação direta
: Transcrição textual de parte da obra do autor consultado.

3.4 citação indireta
: Texto baseado na obra do autor consultado.

3.5 notas de referência
: Notas que indicam fontes consultadas ou remetem a outras partes da obra onde o assunto foi

abordado.

3.6 notas de rodapé
: Indicações, observações ou aditamentos ao texto feitos pelo autor, tradutor ou editor, podendo

também aparecer na margem esquerda ou direita da mancha gráfica.

3.7 notas explicativas
: Notas usadas para comentários, esclarecimentos ou explanações, que não possam ser incluídos

no texto.

4 Localização

As citações podem aparecer:

a) no texto;

b) em notas de rodapé.

5 Regras gerais de apresentação
1)

Nas citações, as chamadas pelo sobrenome do autor, pela instituição responsável ou título incluído na sentença devem ser

em letras maiúsculas e minúsculas e, quando estiverem entre parênteses, devem ser em letras maiúsculas.

Exemplos: A ironia seria assim uma forma implícita de heterogeneidade mostrada, conforme a classificação proposta

por Authier-Reiriz (1982).

“Apesar das aparências, a desconstrução do logocentrismo não é uma psicanálise da filosofia [...]”

(DERRIDA, 1967, p. 293).

5.1
Especificar no texto a(s) página(s), volume(s), tomo(s) ou seção(ões) da fonte consultada, nas citações diretas. Este(s)

deve(m) seguir a data, separado(s) por vírgula e precedido(s) pelo termo, que o(s) caracteriza, de forma abreviada. Nas

citações indiretas, a indicação da(s) página(s) consultada(s) é opcional.

Exemplos: A produção de lítio começa em Searles Lake, Califórnia, em 1928 (MUMFORD, 1949, p. 513).

Oliveira e Leonardos (1943, p. 146) dizem que a "[...] relação da série São Roque com os granitos porfiróides

pequenos é muito clara."

Meyer parte de uma passagem da crônica de “14 de maio”, de A Semana: “Houve sol, e grande sol, naquele

domingo de 1888, em que o Senado votou a lei, que a regente sancionou [...] (ASSIS, 1994, v. 3, p. 583).

5.2
As citações diretas, no texto, de até três linhas, devem estar contidas entre aspas duplas. As aspas simples são

utilizadas para indicar citação no interior da citação.

Exemplos: Barbour (1971, p. 35) descreve: “O estudo da morfologia dos terrenos [...] ativos [...]”

ou

“Não se mova, faça de conta que está morta.” (CLARAC; BONNIN, 1985, p. 72).

Segundo Sá (1995, p. 27): “[...] por meio da mesma ‘arte de conversação’ que abrange tão extensa e

significativa parte da nossa existência cotidiana [...]”

5.3
As citações diretas, no texto, com mais de três linhas, devem ser destacadas com recuo de 4 cm da margem esquerda,

com letra menor que a do texto utilizado e sem as aspas. No caso de documentos datilografados, deve-se observar

apenas o recuo.

Exemplo:
A teleconferência permite ao indivíduo participar de um encontro nacional ou regional sem a necessidade

de deixar seu local de origem. Tipos comuns de teleconferência incluem o uso da televisão, telefone, e

computador. Através de áudio-conferência, utilizando a companhia local de telefone, um sinal de áudio

pode ser emitido em um salão de qualquer dimensão. (NICHOLS, 1993, p. 181).

5.4
Devem ser indicadas as supressões, interpolações, comentários, ênfase ou destaques, do seguinte modo:

a) supressões: [...]

b) interpolações, acréscimos ou comentários: [ ]

c) ênfase ou destaque: grifo ou negrito ou itálico.

5.5
Quando se tratar de dados obtidos por informação verbal (palestras, debates, comunicações etc.), indicar, entre

parênteses, a expressão informação verbal, mencionando-se os dados disponíveis, em nota de rodapé.

_____________________

1)
O uso do ponto final após as citações deve atender às regras gramaticais.

NBR 10520:2002 3

Exemplo: No texto:

O novo medicamento estará disponível até o final deste semestre (informação verbal)
1.

No rodapé da página:

_________________

1
Notícia fornecida por John A. Smith no Congresso Internacional de Engenharia Genética, em Londres, em outubro de 2001.

5.6
Na citação de trabalhos em fase de elaboração, deve ser mencionado o fato, indicando-se os dados disponíveis, em

nota de rodapé.

Exemplo: No texto:

Os poetas selecionados contribuíram para a consolidação da poesia no Rio Grande do Sul, séculos XIX e

XX (em fase de elaboração)
1.

No rodapé da página:

_________________

1
Poetas rio-grandenses, de autoria de Elvo Clemente, a ser editado pela EDIPUCRS, 2002.

5.7
Para enfatizar trechos da citação, deve-se destacá-los indicando esta alteração com a expressão grifo nosso entre

parênteses, após a chamada da citação, ou grifo do autor, caso o destaque já faça parte da obra consultada.

Exemplos: “[...] para que não tenha lugar a
producção de degenerados, quer physicos quer moraes, misérias,

verdadeiras ameaças à sociedade.” (SOUTO, 1916, p. 46, grifo nosso).

“[...] b) desejo de criar uma literatura
independente, diversa, de vez que, aparecendo o classicismo como

manifestação de passado colonial [...]” (CANDIDO, 1993, v. 2, p. 12, grifo do autor).

5.8
Quando a citação incluir texto traduzido pelo autor, deve-se incluir, após a chamada da citação, a expressão tradução

nossa, entre parênteses.

Exemplo:

“Ao fazê-lo pode estar envolto em culpa, perversão, ódio de si mesmo [...] pode julgar-se pecador e

identificar-se com seu pecado.” (RAHNER, 1962, v. 4, p. 463, tradução nossa).

6 Sistema de chamada

As citações devem ser indicadas no texto por um sistema de chamada: numérico ou autor-data.

6.1
Qualquer que seja o método adotado, deve ser seguido consistentemente ao longo de todo o trabalho, permitindo sua

correlação na lista de referências ou em notas de rodapé.

6.1.1
Quando o(s) nome(s) do(s) autor(es), instituição(ões) responsável(eis) estiver(em) incluído(s) na sentença,

indica-se a data, entre parênteses, acrescida da(s) página(s), se a citação for direta.

Exemplos: Em Teatro Aberto (1963) relata-se a emergência do teatro do absurdo.

Segundo Morais (1955, p. 32) assinala "[...] a presença de concreções de bauxita no Rio Cricon."

6.1.2
Quando houver coincidência de sobrenomes de autores, acrescentam-se as iniciais de seus prenomes; se mesmo

assim existir coincidência, colocam-se os prenomes por extenso.

Exemplos: (BARBOSA, C., 1958) (BARBOSA, Cássio, 1965)

(BARBOSA, O., 1959) (BARBOSA, Celso, 1965)

6.1.3
As citações de diversos documentos de um mesmo autor, publicados num mesmo ano, são distinguidas pelo

acréscimo de letras minúsculas, em ordem alfabética, após a data e sem espacejamento, conforme a lista de referências.

Exemplos: De acordo com Reeside (1927a)

(REESIDE, 1927b)

6.1.4
As citações indiretas de diversos documentos da mesma autoria, publicados em anos diferentes e mencionados

simultaneamente, têm as suas datas separadas por vírgula.

Exemplos: (DREYFUSS, 1989, 1991, 1995)

(CRUZ; CORREA; COSTA, 1998, 1999, 2000)

6.1.5
As citações indiretas de diversos documentos de vários autores, mencionados simultaneamente, devem ser

separadas por ponto-e-vírgula, em ordem alfabética.

4 NBR 10520:2002

Exemplos: Ela polariza e encaminha, sob a forma de “demanda coletiva”, as necessidades de todos (FONSECA, 1997;

PAIVA, 1997; SILVA, 1997).

Diversos autores salientam a importância do “acontecimento desencadeador” no início de um processo de

aprendizagem (CROSS, 1984; KNOX, 1986; MEZIROW, 1991).

6.2 Sistema numérico

Neste sistema, a indicação da fonte é feita por uma numeração única e consecutiva, em algarismos arábicos, remetendo à

lista de referências ao final do trabalho, do capítulo ou da parte, na mesma ordem em que aparecem no texto. Não se inicia

a numeração das citações a cada página.

6.2.1
O sistema numérico não deve ser utilizado quando há notas de rodapé.

6.2.2
A indicação da numeração pode ser feita entre parênteses, alinhada ao texto, ou situada pouco acima da linha do

texto em expoente à linha do mesmo, após a pontuação que fecha a citação.

Exemplos: Diz Rui Barbosa: "Tudo é viver, previvendo.” (15)

Diz Rui Barbosa: "Tudo é viver, previvendo."
15

6.3 Sistema autor-data

Neste sistema, a indicação da fonte é feita:

a) pelo sobrenome de cada autor ou pelo nome de cada entidade responsável até o primeiro sinal de pontuação,

seguido(s) da data de publicação do documento e da(s) página(s) da citação, no caso de citação direta, separados por

vírgula e entre parênteses;

Exemplos: No texto:

A chamada “pandectística havia sido a forma particular pela qual o direito romano fora integrado no

século XIX na Alemanha em particular.” (LOPES, 2000, p. 225).

Na lista de referências:

LOPES, José Reinaldo de Lima.
O Direito na História. São Paulo: Max Limonad, 2000.

No texto:

Bobbio (1995, p. 30) com muita propriedade nos lembra, ao comentar esta situação, que os “juristas

medievais justificaram formalmente a validade do direito romano ponderando que este era o direito do

Império Romano que tinha sido reconstituído por Carlos Magno com o nome de Sacro Império Romano.”

Na lista de referências:

BOBBIO, Norberto.
O positivismo jurídico: lições de Filosofia do Direito. São Paulo: Ícone, 1995.

No texto:

De fato, semelhante equacionamento do problema conteria o risco de se considerar a literatura

meramente como uma fonte a mais de conteúdos já previamente disponíveis, em outros lugares, para a

teologia (JOSSUA; METZ, 1976, p. 3).

Na lista de referências:

JOSSUA, Jean Pierre; METZ, Johann Baptist. Editorial: Teologia e Literatura.
Concilium, Petrópolis, v.

115, n. 5, p. 2-5, 1976.

No texto:

Merriam e Caffarella (1991) observam que a localização de recursos tem um papel crucial no processo

de aprendizagem autodirigida.

Na lista de referências:

MERRIAM, S.; CAFFARELLA, R.
Learning in adulthood: a comprehensive guide. San Francisco:

Jossey-Bass, 1991.

No texto:

“Comunidade tem que poder ser intercambiada em qualquer circunstância, sem quaisquer restrições

estatais, pelas moedas dos outros Estados-membros.” (COMISSÃO DAS COMUNIDADES EUROPÉIAS,

1992, p. 34).

Na lista de referências:

COMISSÃO DAS COMUNIDADES EUROPÉIAS.
A união européia. Luxemburgo: Serviço das

Publicações Oficiais das Comunidades Européias, 1992.

NBR 10520:2002 5

No texto:

O mecanismo proposto para viabilizar esta concepção é o chamado Contrato de Gestão, que conduziria

à captação de recursos privados como forma de reduzir os investimentos públicos no ensino superior

(BRASIL, 1995).

Na lista de referências:

BRASIL. Ministério da Administração Federal e da Reforma do Estado.
Plano diretor da reforma do

aparelho do Estado
. Brasília, DF, 1995.

b) pela primeira palavra do título seguida de reticências, no caso das obras sem indicação de autoria ou

responsabilidade, seguida da data de publicação do documento e da(s) página(s) da citação, no caso de citação

direta, separados por vírgula e entre parênteses;

Exemplo: No texto:

“As IES implementarão mecanismos democráticos, legítimos e transparentes de avaliação sistemática

das suas atividades, levando em conta seus objetivos institucionais e seus compromissos para com a

sociedade.” (ANTEPROJETO..., 1987, p. 55).

Na lista de referências:

ANTEPROJETO de lei.
Estudos e Debates, Brasília, DF, n. 13, p. 51-60, jan. 1987.

c) se o título iniciar por artigo (definido ou indefinido), ou monossílabo, este deve ser incluído na indicação da fonte.

Exemplo: No texto:

E eles disseram “globalização”, e soubemos que era assim que chamavam a ordem absurda em que

dinheiro é a única pátria à qual se serve e as fronteiras se diluem, não pela fraternidade, mas pelo

sangramento que engorda poderosos sem nacionalidade. (A FLOR..., 1995, p. 4).

Na lista de referências:

A FLOR Prometida.
Folha de S. Paulo, São Paulo, p. 4, 2 abr. 1995.

No texto:

“Em Nova Londrina (PR), as crianças são levadas às lavouras a partir dos 5 anos.” (NOS CANAVIAIS...,

1995, p. 12).

Na lista de referências:

NOS CANAVIAIS, mutilação em vez de lazer e escola.
O Globo, Rio de Janeiro, 16 jul. 1995. O País,

p. 12.

7 Notas de rodapé

Deve-se utilizar o sistema autor-data para as citações no texto e o numérico para notas explicativas. As notas de rodapé

podem ser conforme 7.1 e 7.2 e devem ser alinhadas, a partir da segunda linha da mesma nota, abaixo da primeira letra da

primeira palavra, de forma a destacar o expoente e sem espaço entre elas e com fonte menor.

Exemplos:

_________________

1
Veja-se como exemplo desse tipo de abordagem o estudo de Netzer (1976).

2
Encontramos esse tipo de perspectiva na 2ª parte do verbete referido na nota anterior, em grande parte do estudo de Rahner (1962).

7.1 Notas de referência

A numeração das notas de referência é feita por algarismos arábicos, devendo ter numeração única e consecutiva para

cada capítulo ou parte. Não se inicia a numeração a cada página.

7.1.1
A primeira citação de uma obra, em nota de rodapé, deve ter sua referência completa.

Exemplo: No rodapé da página:

__________________

8
FARIA, José Eduardo (Org.). Direitos humanos, direitos sociais e justiça. São Paulo: Malheiros, 1994.

7.1.2
As subseqüentes citações da mesma obra podem ser referenciadas de forma abreviada, utilizando as seguintes

expressões, abreviadas quando for o caso:

a) Idem – mesmo autor – Id.;

Exemplo:

__________________

8
ASSOCIAÇÃO BRASILEIRA DE NORMAS TÉCNICAS, 1989, p. 9.

9
Id., 2000, p. 19.

6 NBR 10520:2002

b) Ibidem – na mesma obra – Ibid.;

Exemplo:

__________________

3
DURKHEIM, 1925, p. 176.

4
Ibid., p. 190.

c) Opus citatum, opere citato – obra citada – op. cit.;

Exemplo:

__________________

8
ADORNO, 1996, p. 38.

9
GARLAND, 1990, p. 42-43.

10
ADORNO, op. cit., p. 40.

d) Passim – aqui e ali, em diversas passagens – passim;

Exemplo:

__________________

5
RIBEIRO, 1997, passim.

e) Loco citato – no lugar citado – loc. cit.;

Exemplo:

__________________

4
TOMASELLI; PORTER, 1992, p. 33-46.

5
TOMASELLI; PORTER, loc. cit.

f) Confira, confronte – Cf.;

Exemplo:

__________________

3
Cf. CALDEIRA, 1992.

g) Sequentia – seguinte ou que se segue – et seq.;

Exemplo:

__________________

7
FOUCAULT, 1994, p. 17 et seq.

7.1.3
A expressão apud – citado por, conforme, segundo – pode, também, ser usada no texto.

Exemplos: No texto:

Segundo Silva (1983 apud ABREU, 1999, p. 3) diz ser [...]

“[...] o viés organicista da burocracia estatal e o antiliberalismo da cultura política de 1937, preservado de

modo encapuçado na Carta de 1946.” (VIANNA, 1986, p. 172 apud SEGATTO, 1995, p. 214-215).

No modelo serial de Gough (1972 apud NARDI, 1993), o ato de ler envolve um processamento serial que

começa com uma fixação ocular sobre o texto, prosseguindo da esquerda para a direita de forma linear.

No rodapé da página:

__________________

1
EVANS, 1987 apud SAGE, 1992, p. 2-3.

7.1.4
As expressões constantes nas alíneas a), b), c) e f) de 7.1.2 só podem ser usadas na mesma página ou folha da

citação a que se referem.

7.2 Notas explicativas

A numeração das notas explicativas é feita em algarismos arábicos, devendo ter numeração única e consecutiva para cada

capítulo ou parte. Não se inicia a numeração a cada página.

Exemplos:
No texto:

O comportamento liminar correspondente à adolescência vem se constituindo numa das conquistas

universais, como está, por exemplo, expresso no Estatuto da Criança e do Adolescente.
1

NBR 10520:2002 7

No rodapé da página:

_________________

1
Se a tendência à universalização das representações sobre a periodização dos ciclos de vida desrespeita a especificidade dos valores

culturais de vários grupos, ela é condição para a constituição de adesões e grupos de pressão integrados à moralização de tais formas

de inserção de crianças e de jovens.

No texto:

Os pais estão sempre confrontados diante das duas alternativas: vinculação escolar ou vinculação

profissional.
4

No rodapé da página:

_________________

4
Sobre essa opção dramática, ver também Morice (1996, p. 269-290).

________________