歡迎來到搜尋的世界!
你有沒有想過,電腦是如何在少於一秒的時間內,從數以十億計的網頁中找出答案?當你在搜尋引擎輸入問題時,感覺就像變魔術一樣神奇。但這絕不是魔法,而是精妙的電腦科學!
在這些學習筆記中,我們將會探索搜尋引擎如何探索互聯網、它們如何決定優先顯示哪些結果,以及你怎樣才能化身為「搜尋小偵探」,在網上找到最優秀、最可靠的資訊。
1. 基礎概念:互聯網、萬維網與瀏覽器
在深入了解搜尋引擎前,讓我們先弄清楚大家經常混淆的三種重要工具:
• 互聯網(The Internet): 這是由世界各地互相連接的電腦、線纜和路由器所組成的龐大實體與數碼網絡。試想像它就像一個連接各個城鎮的龐大道路網絡。
• 萬維網(The World Wide Web / WWW): 這是透過超連結在互聯網上傳播的網頁、圖片、影片和文件集合。如果互聯網是道路網絡,那麼萬維網就是所有在上面行駛的汽車和貨車!
• 網頁瀏覽器(Web Browser): 這是安裝在你裝置上的應用程式(例如 Google Chrome、Apple Safari 或 Microsoft Edge),讓你可以開啟並瀏覽網頁。
• 搜尋引擎(Search Engine): 這是一個特殊的網上工具(例如 Google、Bing、DuckDuckGo 或 Yahoo!),協助你在萬維網中尋找特定的網頁。
實用小貼士: 你要先開啟網頁瀏覽器,然後在瀏覽器內使用搜尋引擎來搜尋網頁!
第 1 部分重點回顧
互聯網是實體網絡,萬維網是網頁的集合,網頁瀏覽器讓你看網頁,而搜尋引擎則協助你找出網頁。
2. 搜尋引擎的運作原理:三大步驟
一開始覺得複雜不用擔心,我們可以把整個過程簡化為三個簡單步驟:網絡爬取(Crawling)、建立索引(Indexing)和排序(Ranking)。
第 1 步:網絡爬取(網絡上的蜘蛛)
搜尋引擎使用名為網絡爬蟲(web crawlers)(有時稱為網絡機械人/bots 或網絡蜘蛛/spiders)的特殊自動化程式。這些爬蟲日以繼夜穿梭於萬維網,順着超連結從一個網頁跳到另一個網頁。每當發現新連結,它們就會順着連結探索新網頁,或者檢查舊網頁有沒有更新。
第 2 步:建立索引(建立巨型數碼圖書館)
當網絡爬蟲造訪網頁時,它會閱讀當中的內容、文字、標題及標籤。搜尋引擎會收集所有這些資訊,並儲存在名為索引(index)的龐大資料庫中。
生活比喻: 試想像一本厚厚的實用參考書最後的索引頁。你不需要把整本書從頭讀到尾,只需查閱索引,就能找到介紹「火山」的確切頁數。搜尋引擎的索引原理完全一樣,只是它處理的是數以十億計的網頁!
重要事實: 當你在搜尋列輸入查詢時,搜尋引擎並非即時在活躍的萬維網上搜尋,而是正在搜尋它預先建立好的索引資料庫!
第 3 步:篩選與排序(挑選最佳結果)
當你按下「搜尋」時,眨眼間就會發生兩件事:
1. 篩選: 搜尋引擎會檢查索引,找出所有包含與你搜尋相符的關鍵字網頁。
2. 排序: 搜尋引擎利用演算法(algorithm)(電腦遵循的一組精確規則和步驟)來評估哪些網頁最實用、最相關。然後,它會將結果依序列在搜尋結果頁面(SERP)上。
第 2 部分重點回顧
三個關鍵步驟是:爬取(利用機械人探索網頁)、建立索引(將資訊儲存到資料庫),以及篩選與排序(利用演算法整理相符的搜尋結果)。
3. 搜尋引擎如何為結果排序?
為甚麼有些網頁能榮登榜首,有些網頁卻被排到第五頁?搜尋引擎的演算法會參考幾個重要線索:
• 內容相關度: 該網頁的重要位置(例如主標題、網址 URL、副標題和正文)是否包含完全相符的關鍵字?
• 反向連結(Backlinks): 有多少其他值得信賴的網站連結到這個網頁?在電腦世界中,來自其他網站的連結就像一張「信心投票」,代表該資訊優質而且可靠。
• 時效性與更新: 這些資訊是最近撰寫的嗎?內容有沒有更新最新事實?
• 用戶因素與個人化: 演算法會考慮你的搜尋位置、語言設定、所使用的裝置類型(平板電腦、手機或電腦),以及過往的搜尋記錄。
• 搜尋引擎最佳化(SEO): 網站製作者會運用 SEO 技術,讓網頁結構整齊清晰,方便網絡爬蟲讀取,從而提升網頁的自然排名。
• 付費廣告(商業影響): 結果頁面頂部或側邊的某些連結是商業機構付費刊登的。這些都是廣告,旁邊一定會清楚標示「贊助」或「廣告」。
第 3 部分重點回顧
排序絕非隨機!演算法會綜合考慮關鍵字匹配、外部網站連結、時效性、所在位置,以及是否有商業機構付費刊登贊助廣告。
4. 化身搜尋小偵探:高效搜尋技巧
想迅速找到所需的準確資訊,你可以運用以下實用的搜尋技巧:
使用關鍵字,而非完整句子
與其輸入冗長的口語化句子,例如:「你可以告訴我太陽系中最大的行星叫甚麼名字嗎?」
不如使用清晰、具體的關鍵字:「太陽系 最大行星」。
搜尋引擎擅長辨識核心名詞和描述性詞語!
搜尋列 vs 網址列
• 網址列(Omnibox): 位於瀏覽器視窗最頂部的欄位,你可以直接輸入網站網址(例如以 .org 或 .edu.hk 結尾的 URL),亦可以直接輸入搜尋查詢。
• 搜尋引擎列: 位於搜尋引擎網頁中央的查詢輸入框,供你輸入關鍵字。
使用引號進行精確詞組搜尋
如果你在詞語兩旁加上引號,搜尋引擎就會嚴格按照該順序尋找完全相符的詞組。
例子: 輸入 "日全食",便只會找出這三個字緊密相連的網頁。
善用篩選工具
搜尋引擎提供不同標籤頁來收窄搜尋範圍。你可以點擊圖片、影片、新聞或地圖,亦可以使用時間工具,只檢視過去一年內發布的內容。
第 4 部分重點回顧
關鍵字要具體明確、善用引號搜尋精確詞組,並使用篩選標籤找出合適的媒體類型。
5. 具備審辨能力:評估你找到的資訊
課程指引提醒我們在接觸數碼內容時要具備審辨能力(discerning)。這代表我們要懂得細心思考資訊是否真實、可靠和值得信賴,而不是盲目相信屏幕上看到的一切。
自我提問的聰明問題:
• 這是廣告嗎? 留意搜尋結果有沒有標註「廣告」或「贊助」。廣告的目的是推銷商品,而不一定能提供客觀全面的事實。
• 作者是誰? 作者是專家、學校、博物館,還是公開討論區上的不知名用戶?
• 我可以交叉核對嗎? 如果你看到令人驚訝的資料,不妨多查閱兩至三個可信的網站或參考書籍,看看內容是否一致。
• 網站看起來可靠嗎? 來自官方機構、學校和博物館的權威網站,通常都會經過嚴謹審核以確保資料準確無誤。
第 5 部分重點回顧
切勿盲目相信任何網站!時刻核實作者身份、辨識付費廣告,並透過多個來源交叉核對事實。
6. 常見誤解與迷思(流言終結者!)
迷思 1:「當我按下搜尋時,搜尋引擎會即時在整個互聯網上現場搜尋。」
真相: 不是的!即時搜尋整個網絡會花費極多時間。搜尋引擎其實是在查閱網絡爬蟲預先建立好的索引資料庫。
迷思 2:「搜尋結果是按照網頁建立或被發現的先後次序排列的。」
真相: 結果完全是由演算法根據相關度、質素、連結和排名規則嚴格排列,而不是按照發現日期排序。
迷思 3:「排在最頂的第一個連結一定是最準確、最真實的。」
真相: 最頂部的連結可能是付費廣告(贊助),或者是運用了高超 SEO 技術的網頁。排名高並不保證當中每個事實都完全真實。
迷思 4:「網頁瀏覽器和搜尋引擎是同一種東西。」
真相: 瀏覽器是用來開啟和檢視網頁的應用程式(例如 Chrome、Safari)。搜尋引擎則是在瀏覽器內運作、用來尋找網頁的網上服務(例如 Google、Bing)。
快速重點複習
• 網絡爬蟲/蜘蛛: 順着連結穿梭並探索網頁的自動化機械人。
• 索引: 儲存已探索網頁及關鍵字的龐大資料庫。
• 演算法: 用於篩選最相關結果並進行排序的一組規則。
• 排序因素: 關鍵字、外部連結、時效性、所在位置及廣告。
• 高效搜尋: 使用精確關鍵字、精確詞組引號("如這樣")以及篩選工具。
• 審辨思考: 時刻交叉核對事實,並主動辨識贊助廣告。