검색엔진
IT 위키
더 많은 작업
검색엔진(Search Engine)은 웹에 흩어진 문서를 자동으로 수집하고 색인해 두었다가, 사용자가 입력한 질의에 맞는 문서를 관련도 순으로 찾아 보여 주는 시스템이다.
검색엔진은 크롤러가 웹 문서를 모으고, 색인기가 문서 속 낱말과 위치를 역색인(inverted index)으로 정리하고, 검색기가 질의를 받아 순위를 매겨 결과를 돌려주는 세 단계로 움직인다. 구글 검색, 마이크로소프트 빙, 덕덕고처럼 검색 결과를 내는 것 자체가 서비스의 중심이다. 반면 검색 포털은 검색을 관문으로 삼아 뉴스·메일·카페·쇼핑 같은 서비스를 한데 모은 사이트다. 검색은 포털이 제공하는 여러 서비스 중 하나다.
| 구성 요소 | 하는 일 |
|---|---|
| 크롤러(로봇, 스파이더) | 링크를 따라 다니며 웹 문서를 수집한다. 사이트는 robots.txt 로 수집 범위를 알린다 |
| 색인기(인덱서) | 수집한 문서를 분석해 낱말 → 문서 목록의 역색인을 만든다. 형태소 분석, 불용어 제거가 여기서 이루어진다 |
| 검색기(질의 처리기) | 질의를 분석해 색인에서 후보 문서를 찾는다 |
| 순위 결정(랭킹) | 낱말 빈도(TF-IDF), 링크 구조(페이지랭크), 최신성, 이용자 반응 등으로 순서를 매긴다 |
| 종류 | 방식 | 예 |
|---|---|---|
| 로봇(키워드)형 | 크롤러가 자동으로 모은 문서를 낱말로 찾는다 | 구글, 빙 |
| 디렉터리(주제별)형 | 사람이 사이트를 주제 분류에 등록해 두고 분류를 따라 찾는다 | 초기 야후 디렉터리 |
| 메타 검색 | 자체 색인 없이 여러 검색엔진에 질의를 보내 결과를 모아 보여 준다 | 여러 엔진의 결과를 합쳐 중복을 지운다 |
| 통합 검색 | 웹 문서·뉴스·이미지·블로그 등 여러 영역의 결과를 한 화면에 나누어 보여 준다 | 네이버·다음의 검색 결과 화면 |
| 구분 | 검색엔진 | 검색 포털 |
|---|---|---|
| 목적 | 질의에 맞는 외부 문서로 빨리 보내는 것 | 이용자를 사이트 안에 오래 머물게 하는 것 |
| 중심 기능 | 웹 문서의 수집·색인·순위 | 검색 + 뉴스·메일·카페·블로그·쇼핑·지도 등 자체 서비스 |
| 검색 대상 | 웹 전체(개방형) | 웹 문서와 자체 생산 콘텐츠를 함께, 자체 콘텐츠를 앞에 두는 경향(폐쇄형 성격) |
| 결과 화면 | 문서 목록 위주 | 영역별로 나눈 통합 검색 결과, 지식 서비스·광고를 함께 배치 |
| 수익 | 검색 광고 | 검색 광고 + 디스플레이 광고 + 쇼핑 중개·유료 서비스 |
| 사례 | 구글 검색, 빙, 덕덕고 | 네이버, 다음, 야후 |
- 같은 회사가 둘 다를 갖기도 한다. 구글은 검색엔진 중심으로 출발해 지메일·유튜브를 붙였고, 네이버는 통합 검색과 지식iN·카페·블로그 같은 자체 콘텐츠를 키워 포털이 되었다.
- 포털이 자체 콘텐츠를 우선 노출하면 이용자는 편하지만 외부 웹 문서가 덜 보이게 되고, 검색 결과의 공정성과 필터 버블 문제가 제기된다.