意味が深いほど、学習は難しくなるのか
頻度は意味の反対ではない。だが稀で状況に根ざした意味ほど、モデルが直接受け取る統計的な支えは少なくなりやすい。
逆説ではなく警告として
「意味が深い語ほどAIは学べない」という命題は、普遍法則としては成立しない。「私」「愛」「正義」のように頻出しながら重い語もあり、珍しいだけで無意味な記号もある。言語モデルは単に語数を数える装置ではなく、大量の文脈から分布パターンを予測し、既知の断片を組み合わせて未見の表現にも対応する。
それでも警告として残るものがある。ある人、学問、文化にとって決定的な意味が、きわめて少数の文脈にしか現れない場合、モデルが直接学べる例は少ない。たとえば英語の定冠詞は膨大な日常例を持つが、カントのDing an sich、物自体は、稀少で論争的な哲学史の中で働く。どちらも流暢に説明できても、同じ厚みで根拠づけられているとは限らない。
より正確な主張はこうだ。高密度で文脈依存の概念は、普通の接続表現より直接の監督信号が少ないことがある。頻度は意味を測らないが、どの区別を安定して学びやすいかには影響する。
モデルより先にある切断
言語モデルが文字列を処理する前に、トークナイザーが文章を計算可能な単位へ写像する。BPEに由来する方式では、高頻度のバイト列や文字列を反復的にまとめ、稀な列を複数単位へ分ける。これは巨大な語彙を効率よく扱う優れた工学的仕組みである。
単語が複数トークンに分かれたからといって、意味が必ず壊れるわけではない。Transformerは複数単位を横断して概念を構成できる。したがって「物自体が三つに切られれば、AIには理解不能だ」という言い方は強すぎる。
限界は別にある。語彙境界は統計的効率のために最適化され、どの概念が人間にとって重要かという理論を提供しない。一方、意味論的な仕事は、表記が複数単位でも「物自体」を一つの概念として扱い、議論の分岐を追い、ある用法が忠実か装飾的かを判断する。圧縮と理解は協働できるが、同じ課題ではない。
「反比定律」を狭く定義する
私的な誓い、新しい科学上の区別、少数派の慣用、専門概念の精密な用法。重要でありながら稀な意味は確かに存在する。稀であれば、異なる状況における直接例が少なく、核心と偶然的特徴を分けにくい。しかし稀なものすべてが重要ではなく、一般的な語が空虚でもない。合成的な一般化によって少数例から学べる場合も多い。
そこで本稿の「反比定律」を、定理ではなくヒューリスティックとして読み直す。直接の統計的支えが少なくなるほど、その場の文脈と重要性を判断する人間の仕事が大きくなる傾向がある、という警告である。意味得点と頻度が固定的に反比例するという法則ではない。
より良いデータ、検索、道具、少数例学習、多言語訓練は境界を改善できる。だが稀少性のすべてがデータセットの事故ではない。新しく、局所的で、争われ、深く個人的な意味は、人が実際にまれにしか使わないから稀である。規模は境界を動かすが、余項が必ず消えるとは保証しない。
SAEでは、構造化はある区別を安くし、別の区別を高価で見えにくくする、と考える。これを余項保存と呼ぶ。トークン化が意味を一括して捨てるのではない。意味は複数の構造を通過し、それぞれの最適化目標と一致しない部分が余項として残る。
自分の地盤は内側から保証できない
モデルは、自ら選んでいないトークナイザーと訓練パイプラインの下流で働く。文脈から複数トークンの概念を推定でき、道具があれば分割自体を調べることもできる。それでも流暢な継続だけから、訓練過程が優先した区別こそ、この場面で重要な区別だという独立の保証は得られない。
データについても同じだ。ある思想伝統が批判者の言葉でばかり記録されていれば、モデルはその偏りを首尾一貫した説明として学ぶ。先住民の概念が近似的な西洋語へ繰り返し翻訳されれば、頻度は近似を標準へ変える。最も多い読みが、まさに問い直すべき読みである可能性を、量だけでは判定できない。
人間にも中立的な保証はない。専門家も誤り、共同体も偏る。ただし人は、異なる位置を持ち込める。生活上の利害、専門実践、少数派の用法、そして統計的に自然な解釈が要点を外していると言う責任である。
一つの概念と長く暮らした人は、機械的に滑らかな説明の歪みを感じることがある。理解できなかった夜、突然つながった瞬間、誤読をめぐる論争、確信が崩れ再建された時間。これは計算量ではなく、概念がその人の生と実践に置いた賭金である。
日本語を「英語以外」で一括しない
トークン効率はモデルと訓練混合によって異なる。初期あるいは英語偏重の語彙では、日本語や中国語が同等内容の英語より多くのトークンを消費する場合があった。新しい多言語トークナイザーは格差を縮めており、すべてのシステムに共通する固定比率はない。
日本語にはさらに、分かち書きをしない表記、漢字・ひらがな・カタカナ・ラテン文字の混在、同じ概念を異なる文字種で書ける特性がある。これらは本質的に「難しい」のではなく、語彙配分と学習資料の設計によってコストが変わる。
格差が残る場合、同じ仕事に多くの文脈窓と計算費用を使う。誰かが悪意で日本語を排除したのでなくても、豊富な資料を標準として最適化すれば、少ない資料は例外として高くつく。この構造を植民的と呼ぶなら、意図の告発ではなく、基準が一つの立場を無意識に中心化する仕方を指すべきだ。
日本語の中にも差がある。標準語、企業文書、ネット語は豊富でも、方言、古典語、専門共同体、障害当事者の語彙は稀かもしれない。多言語性は国語名の一覧だけで測れない。
人間は暫定的な監督者ではない
「今は人が確認するが、将来は機械だけで済む」という物語は、判断を単なる誤植検査として扱う。だが賭金、新規性、局所的意味が関わる仕事では、人間の役割は一時的な不便ではない。何を一つの概念として守り、どの例外を重く見て、誰の損失を許容しないかに答える位置である。
これは「意味は人間にしかわからない」という神秘主義ではない。AIは用例を比較し、忘れられた資料を検索し、人が見落とした集まりを示せる。人間の判断も権威主義や無知に陥る。重要なのは、計算に境界が出たから正しいとせず、この文脈でなぜその境界が支配すべきか、誰かが説明責任を負うことだ。
良い人間判断の質と複数性は、人間―AI系全体の天井を決めうる。算力やデータが重要でないのではない。それらだけが変数ではない。Self-as-an-Endは技術的必然から自動的に導かれる標語ではなく、人をAI性能の手段だけにしないという道徳的・制度的な選択である。
先に自分で書く
日常の危険は、AIが秘密の意志を持つことより、人が判断を使わなくなることにある。最初の答えが滑らかであるほど、自分の仮説をつくる必要を感じない。AIの枠から編集を始めれば、ゼロから考えたときに現れたはずの稀な違和感は、循環へ入らない。
対処は単純である。AIに聞く前に、自分の判断を数行書く。未熟で、穴があり、言葉にならなくてよい。指が止まる瞬間は、無駄ではない。問題がまだ既製の回答へ圧縮されていない場所である。
その後でAIに反論、先行例、見落としを求める。自分の切断を、モデルの広い射程で揺さぶる。そしてもう一度、自分で書く。順序を守れば、AIは人間の問いがすでに印をつけた場へ入る。逆にすれば、人はAIのもっともらしさを整える編集者になりやすい。
書字は身振りと沈黙を、印刷は筆跡と余白を、デジタル化は別の何かを余項として残してきた。統計学習も意味を全て失うのではないが、稀で状況に根ざした意味を安定させにくいことがある。その差を担うのは、最頻の答えより一つの違和感を重要だと言える人である。
最新の中国語原文と英語版の論証を基に、日本語読者のために構成と文章を新たに組み直した独立編集・再構成版です。「反比定律」は普遍法則でなく、直接の統計的支えが少ない場面での実践的ヒューリスティックとして扱っています。 中文・English