問題
文字コード UTF-8 で日本語の1文字は通常何バイトで表現されるか。
選択肢
- 11バイト
- 22バイト
- 33バイト
- 44バイト
正解
3. 3バイト
詳しい解説を見る解説を閉じる
解説
UTF-8は、Unicodeの文字を1〜4バイトの可変長で符号化する方式である。ASCIIと互換の英数字・基本記号は1バイト、ギリシャ文字やキリル文字など多くの欧州系文字は2バイト、ひらがな・カタカナ・常用漢字など日本語の文字は通常3バイト、一部の追加漢字や絵文字は4バイトで表現される。したがって日本語の1文字は通常3バイトである。1バイトで済むのはASCII文字の場合である。2バイトは、Shift_JISやEUC-JPといった従来の日本語文字コードで全角文字が2バイトだったことと混同しやすいので注意したい。4バイトは絵文字などに限られる。基本情報では、UTF-8が可変長でASCII互換であるという特徴と、Unicode・Shift_JIS・EUC-JPなど文字コード体系の違いの対応付けが頻出ポイントである。
一問一答
科目A 180問+科目B 60問