June 2026
Intermediate
804 pages
8h 21m
Japanese
私はテキストに人生を捧げている。テキストは私の天職だ。
—— イアン・マッケラン
文字列操作の基礎は「4章 文字列」で説明した。本章では文字列とテキストデータをより深く掘り下げる。
Python 3の文字列はbytesではなくUnicode文字のシーケンスである。Python 2とPython 3を比べた場合、文字列が言語としての最大の違いである。
本書のこれまでのテキスト関連のコード例はすべてASCIIを使ってきた。ASCIIは1960年代に定義された。当時のコンピュータは冷蔵庫ほどの大きさで、計算が少し得意なだけだった。
「2章 データ型と変数」で述べたように、コンピュータの記憶の基本単位はバイトであり、8個のビットで256種類の一意な値を表現できる。ASCIIはさまざまな理由から7ビット(128種類の一意な値)しか使っていない。26種類の大文字と26種類の小文字、10種類の数字、記号、空白文字、制御コードが含まれている。
しかし、世界にはASCIIで表現できる以上の文字がある。夕食にホットドッグは食べられても、カフェ(café)でゲヴュルツトラミネール(Gewürztraminer)†1は飲めなくなってしまう。8ビットにもっと多くの文字と記号を詰め込むために、さまざまな試みがなされてきた。
[†1] この品種のワインはドイツ語ではウムラウトがつくが、フランスに向かってアルザスに入るとウムラウトが消える。
そうした試みから2つだけを紹介する。
8ビットをフルに使用しているがそれでも十分ではない。特にヨーロッパ以外の言語が必要な場合はそうである。 ...
Read now
Unlock full access