A Hypertext Categorization Method using Incrementally Computable Class Link Information

점진적으로 계산되는 분류정보와 링크정보를 이용한 하이퍼텍스트 문서 분류 방법

  • 오효정 (한국전자통신연구원 휴먼정보처리부) ;
  • 맹성현 (충남대학교 컴퓨터학과)
  • Published : 2002.08.01

Abstract

As WWW grows at an increasing speed, a classifier targeted at hypertext has become in high demand. While document categorization il quite mature, the issue of utilizing hypertext structure and hyperlinks has been relatively unexplored. In this paper, we propose a practical method for enhancing both the speed and the quality of hypertext categorization using hyerlinks. In comparison against a recently proposed technique that appears to be the only one of the kind, we obtained up to 18.5% of improvement in effectiveness while reducing the processing time dramatically. We attempt to explain through experiments what factors contribute to tile improvement.

본 논문은 하이퍼텍스트가 갖는 중요한 특성인 링크 정보를 활용한 문서 분류 모델을 제안한다. 제안된 모델의 주안점은 대상 문서와 링크로 연결된 이웃한 문서의 내용 및 범주를 분석하여 대상 문서 벡터를 조정하고, 이를 근거로 대상 문서가 어느 범주에 해당하는지를 결정한다. 또한, 이웃 문서에 포함된 용어를 반영함으로써 대상 문서의 내용을 확장 해석하고, 이웃 문서의 가용 분류 정보가 있는 경우 이를 참조함으로써 정확도 향상을 기한다. 이러한 접근 방법은 일반 웹 환경에 적용할 수 있는데, 특히 하이퍼텍스트를 주제별로 분류하여 관리하는 검색 엔진의 경우 매일 쏟아져 나오는 새로운 문서와 기존 문서간의 링크를 활용함으로써 전체 시스템의 점진적인 분류에 매우 유용하다. 제안된 모델을 검증하기 위하여 Reuter-21578과 계몽사(ETRl-Kyemong) 자료를 대상으로 실험한 결과 최고 18.5%의 성능 향상을 얻었다.

Keywords

References

  1. J. M. Lim, H. J. Oh, S. H. Myaeng, M. H. Lee, 'Improving Efficiency with Document Category Information in Link-based Retrieval,' Proc. of the International Workshop on IRAL'99, 1999
  2. Kleinberg, J., 'Authoritative Source in a Hyperlinked Environment,' Proc. of the 9th annual international ACM-SIAM '98, 1998
  3. Won-Kyun Joo and Sung-Hyoun Myaeng, 'Improving Retrieval Effectiveness with Link Information,' Proc. of the International Workshop on IRAL'98, 1998
  4. 정성화, 이종혁, '문서 구조 정보에 기반한 웹 페이지 범주화 모델', 제 10회 한글 및 한국어 정보처리학술 대회, 1998
  5. Susan Dumais and Hao Chen, 'Hierarchical Classification of Web Content,' Proc. of the 23th annual international ACM-SIGIR, July 2000 https://doi.org/10.1145/345508.345593
  6. Soumen Chakrabarti, Byron Dom, and Piotr Indyk, 'Enhanced Hypertext Categorization using Hyperlinks,' Proc. of the International Conference on SIGMOD '98, 1998 https://doi.org/10.1145/276304.276332
  7. 이호, 단어 의미 중의성 해결을 위한 분류 정보 모형, 고려대학교 박사학위 논문, 1999
  8. Keiichiro Hoashi, Kazunori Matsumoto, Naomi Inoue, and Kazuo Hashimoto, 'Document Filtering Method Using Non-Relevant Information Profile,' Proc. of the 23th annual international ACM-SIGIR, July 2001 https://doi.org/10.1145/345508.345573
  9. Yu-Hwan Kim, Shang-Yoon Hahn, and Byoung-Tak Zhang, 'Text filtering by boosting naive Bayes Classifiers,' Proc. of the 23th annual international ACM-SIGIR, July 2000 https://doi.org/10.1145/345508.345572
  10. David D. Lewis, Representation and Learing in Information Retrieval, Ph.D thesis, Dep. of Computer Science, Univ. of Massachusetts, 1992
  11. P. J. Hayes, P. M. Andersen, I. B. Niernburg, and L. M. Schmandt, 'TCS: A Shell for Content-Based Text Categorization,' Proc. of the 6th IEEE-CAIA '90, 1990
  12. Mark Craven, Dan Di Pasquo, Dayne Freitag, Andrew McCallum, Tom Mitchell, Kamal Nigam, and Sean Slattery, 'Learing to Extract Knowledge from the World Wide Web,' Proc. of the International Workshop on AAAI '98, 1998
  13. Yiming Yang and Xin Liu, 'A Re-examination Of Text Categorization Methods,' Proc. the of 22th annual international ACM-SIGIR, 1999 https://doi.org/10.1145/312624.312647
  14. Chidanand Apt, Fred Damerau, and Sholom M. Weis, 'Towards Language Independent Automated Learning of Text Categorization models,' Proc. of the 17th annual international ACM-SIGIR, 1994
  15. R. E. Shapire, Yoram Singhal, and Amit Singhal, 'Boosting and Rocchio applied to text filtering,' Proc. of the 21th annual international ACM-SIGIR, 1998 https://doi.org/10.1145/290941.290996
  16. David D. Lewis and Marc. Ringuette, 'A Comparison of Two Learning Algorithms for Text Categorization,' Proc. of the 3rd Annual Symposium on Document Analysis and information Retrieval, 1994
  17. Mart A. Hearst, 'Support Vector Machines,' IEEE Information Systems, 13(4): 18-28, 1998
  18. Susan Dumais, John Platt, David Heckerman, and Mehran Sahami, 'Inductive Learning Algorithms and Representations for Text Categorization,' Proc. of the 7th international Conference on CIKM '98, 1998 https://doi.org/10.1145/288627.288651
  19. Leah S. Larkey and W. Bruce Croft, 'Combining Classifiers in Text Categorization,' Proc. of the 19th annual international ACM-SIGIR 96, 1996 https://doi.org/10.1145/243199.243276
  20. L. Pelkowitz, 'A Continuous Relaxation Labeling Algorithm for Markov Random Fields,' IEEE Trans, on Systems, Man and Cybernetics, 20(3): 705-715, 1990 https://doi.org/10.1109/21.57279
  21. 조은일, 임정묵, 오효정, 이만호, 맹성현, 'CORBA와 JAVA를 사용한 에이전트 기반 디지털 도서관 프로토 타입 구현', 한국정보과학회 춘계 학술대회, 1999
  22. 장동현, 맹성현, '효율적인 색인어 추출을 위한 복합명사 분석방법', 제8회 한글 및 한국어 정보처리학술대회, 1996
  23. L. Douglas Baker and Andrew K. McCallum, 'Distributional Clustering of Words for Text Classification,' Proc. of the 21st annual international ACM-SIGIR, 1998 https://doi.org/10.1145/290941.290970