Tổng quan về hệ thống máy tìm kiếm (Search Engine) Bài viết sẽ giúp chúng ta nhìn nhận một cách khái quát nhất về hệ thống các máy tìm kiếm (search engine) trên thế giới, một trong những kênh quảng bá quan trọng nhất của các website. Các bộ phận cấu thành hệ thống máy tìm kiếm search engine Bộ thu thập thông tin – Robot Robot là một chương trình tự động duyệt qua các cấu trúc siêu liên kết để thu thập tài liệu & một cách đệ quy nó nhận về tất cả tài liệu có liên. | Tổng quan về hệ thống máy tìm kiếm Search Engine Bài viết sẽ giúp chúng ta nhìn nhận một cách khái quát nhất về hệ thống các máy tìm kiếm search engine trên thế giới một trong những kênh quảng bá quan trọng nhất của các website. Các bộ phận cấu thành hệ thống máy tìm kiếm search engine Bộ thu thập thông tin - Robot Robot là một chương trình tự động duyệt qua các cấu trúc siêu liên kết để thu thập tài liệu một cách đệ quy nó nhận về tất cả tài liệu có liên kết với tài liệu này. Robot được biết đến dưới nhiều tên gọi khác nhau spider web wanderer hoặc web worm . Những tên gọi này đôi khi gây nhầm lẫn như từ spider wanderer làm người ta nghĩ rằng robot tự nó di chuyển và từ worm làm người ta liên tưởng đến virus. Về bản chất robot chỉ là một chương trình duyệt và thu thập thông tin từ các site theo đúng giao thức web. Những trình duyệt thông thường không được xem là robot do thiếu tính chủ động chúng chỉ duyệt web khi có sự tác động của con người. Bộ lập chỉ mục - Index Hệ thống lập chỉ mục hay còn gọi là hệ thống phân tích và xử lý dữ liệu thực hiện việc phân tích trích chọn những thông tin cần thiết thường là các từ đơn từ ghép cụm từ quan trọng từ những dữ liệu mà robot thu thập được và tổ chức thành cơ sở dữ liệu riêng để có thể tìm kiếm trên đó một cách nhanh chóng hiệu quả. Hệ thống chỉ mục là danh sách các từ khoá chỉ rõ các từ khoá nào xuất hiện ở trang nào địa chỉ nào. Bộ tìm kiếm thông tin - Search Engine Search engine là cụm từ dùng chỉ toàn bộ hệ thống bao gồm bộ thu thập thông tin bộ lập chỉ mục bộ tìm kiếm thông tin. Các bộ này hoạt động liên tục từ lúc khởi động hệ thống chúng phụ thuộc lẫn nhau về mặt dữ liệu nhưng độc lập với nhau về mặt hoạt động. Search engine tương tác với user thông qua giao diện web có nhiệm vụ tiếp nhận trả về những tài liệu thoả yêu cầu của user. Nói nôm na tìm kiếm từ là tìm kiếm các trang mà những từ trong câu truy vấn query xuất hiện nhiều nhất ngoại trừ stopword các từ quá thông dụng như mạo từ a an the . . Một từ càng xuất