歡迎來到「中文字型處理」的世界!
你有沒有想過,電腦明明只懂得數字,卻能顯示出成千上萬既美觀又複雜的中文字?英文只有 26 個字母,但中文卻有數以萬計的字符!在本章中,我們將會探索電腦如何透過輸入法、內碼以及造字,來架起溝通的橋樑。
1. 中文輸入法 (Chinese Input Methods)
由於標準鍵盤沒有數千個按鍵,我們需要一種特殊的方法來告訴電腦我們想輸入哪個字,這就是輸入法。
輸入法的分類
我們與電腦「溝通」中文主要有三種方式:
A. 辨形輸入法
這類方法將中文字拆解成不同的視覺部分或「字根」。
例子:倉頡和速成。例如輸入「明」字,你會聯想到「日」和「月」這兩個字形。
優點:熟練後輸入速度極快;不需要知道讀音。
缺點:學習難度較高,因為你必須記住字根和拆字規則。
B. 辨音輸入法
這類方法根據漢字的發音(語音)來輸入。
例子:拼音或粵拼。
優點:只要懂得口語讀音,就非常容易學習。
缺點:中文有很多同音字,你經常要從候選列表中挑選正確的字,這會減慢輸入速度。
C. 數位/輔助輸入法
這類方法利用現代科技,例如手寫辨識或語音辨識(通常由人工智慧 AI 驅動!)。
優點:非常適合手機用戶,或是不懂得鍵盤編碼的人。
缺點:有時會誤讀你的筆跡或聽錯你的聲音。
重點小結:不同的輸入法適合不同的需求。專業人士可能會為了追求速度而學習倉頡,而學生則可能因為容易上手而偏好拼音!
2. 中文內碼 (Internal Codes for Chinese)
當你「輸入」一個字後,電腦並不能直接儲存那個「字形」,它必須將其轉換為二進制碼(由 \(0\) 和 \(1\) 組成的序列)。內碼就像是為每個中文字分配的一個專屬身份證號碼。
常見的編碼標準
過去,不同地區使用不同的「身份證名冊」(編碼標準):
1. Big5(大五碼):主要用於繁體中文字(在香港和台灣非常流行)。
2. GB(國標碼):主要用於簡體中文字。
3. Unicode(統一碼):這是一門「世界通用的語言」。它是一個現代標準,將世界上幾乎所有語言(中文、英文、表情符號 Emoji 等)都收錄在一個龐大的列表中!
你知道嗎?如果你打開一個檔案時看到像「§ï¿½」這樣的亂碼,通常是因為電腦用了錯誤的「身份證名冊」(內碼)來解讀檔案!
快速複習:電腦使用內碼在內部將字元表示為二進制碼,以便進行處理和儲存。
3. 中文字造字的需要 (Customised Chinese Characters)
雖然 Unicode 已經收錄了數萬個字,但有時我們還是會遇到「失蹤」的字,這就是為什麼我們需要中文字造字。
為什麼我們需要「造字」?
A. 罕見姓名:有些人的名字包含非常古老或罕見的字,而這些字並不在電腦的標準列表內。
B. 特定方言:香港常用的一些粵語口語字,在標準編碼系統中可能找不到。
C. 新詞彙:偶爾出現的新科學術語或流行語,也可能需要新的符號。
當某個字缺失時,我們可以使用「造字程式」畫出字形並為其分配一個私有碼。不過要注意:如果你把一個「造得的字」發給朋友,除非他們的電腦也安裝了同一個造字檔,否則他們可能無法看到這個字!
4. 運作原理:數據流 (The Data Flow)
讓我們來看看電腦處理一個中文字的步驟:
第一步 (輸入):你使用輸入法(如速成)來選擇一個字。
第二步 (處理):電腦將你的選擇轉換成對應的內碼。
第三步 (儲存):內碼以二進制碼 \( (0, 1) \) 的形式儲存在記憶體中。
第四步 (輸出):電腦根據該內碼查找對應的「字型」(font),並將字形顯示在你的螢幕上。
記憶小技巧:把輸入法想成翻譯員,把內碼想成身份證,而二進制碼就是電腦的心跳。
總結清單
• 輸入法:倉頡/速成(辨形)、拼音(辨音)、手寫(數位)。
• 內碼:Big5(繁體)、GB(簡體)、Unicode(萬國通用)。
• 造字:用於標準列表中沒有的罕見姓名或方言字。
• 二進制:所有中文字在電腦硬體內部的最終形態。
如果編碼部分看起來很複雜,請不要擔心!只要記住:電腦需要一個「數字」(內碼)來代表你所看到的每一個「圖像」(中文字)就可以了。