2015年3月に書いた「tf-idfで各政党の特徴を探る」という記事がある。
自民党・民主党・公明党・維新の党・日本共産党・次世代の党・社民党という7党の綱領を形態素解析にかけ、tf-idfで「その党らしい単語」を抜き出してみた回だ。
あれから11年半。ふと読み返して気づいた。
tf-idfという手法自体は当時のままでも十分通用する枯れた技術なのに、肝心の「政党」という分析対象のほうが、原形をとどめないくらい変わってしまっていた。
民主党はもう存在しないし、当時なかった政党のほうが今や勢力を持っていたりする。しかもこの記事を書いている2026年9月時点、永田町はつい数週間前まで「新党結成→衆院選惨敗→分裂」という激動のただ中にいた。
というわけで今回は、①同じtf-idfという物差しで2026年時点の政党を測り直しつつ、②11年間で政党そのものがどれだけ様変わりしたかも眺め、③ついでに「政治テキストをAIで分析する」という営み自体が2026年にはどこまで進んでいるのかも覗いてみる、という三本立てでお送りする。
あらかじめお断りしておくと、今回もどこかの政党を持ち上げたり貶めたりする意図は一切ない。綱領という「その党が最も気合いを入れて自党の言葉を選んだ文章」を機械的に数えているだけ、という前提で読んでいただきたい。
tf-idfのおさらい
tf-idfの数式や具体例は11年前の記事で散々書いたのでそちらに譲るとして、一言でまとめ直すと
「その文章によく出てくるけど、他の文章にはあまり出てこない単語」を機械的にあぶり出す指標である。tf(その文章内での出現頻度)とidf(他の文章にどれだけ出現しないか)の掛け算で、「党名」や「主義」のようなどこにでも出てくる単語のスコアを下げ、その党固有の言葉遣いを浮かび上がらせる。
2015年当時はPythonのMeCab+nltkで計算していたが、今回はfugashi(MeCabのモダンなPythonラッパー)+scikit-learnのTfidfVectorizerを使った。品詞は名詞・動詞・形容詞・形状詞(旧来の「形容動詞」に相当)に絞り、活用形は原形に統一している。このあたりの基本的な設計は11年前とほぼ同じで、ここは全く枯れていない技術ではないことがよくわかる。
1. 使用するデータ
2026年9月時点で国政に議席を持つ主要政党のうち、公式サイトに綱領・基本政策のページを公開している10党を対象にした。
| 政党 | 綱領・基本政策ページ |
| 自由民主党 | 立党宣言・綱領 |
| 立憲民主党 | 綱領/基本政策 |
| 公明党 | 綱領 |
| 日本維新の会 | 綱領・基本方針 |
| 国民民主党 | 綱領 |
| 日本共産党 | 日本共産党綱領 |
| れいわ新選組 | 決意(綱領)・規約 |
| 参政党 | 十の柱/政策カタログ |
| 日本保守党 | 結党宣言/党規約と綱領 |
| 社会民主党 | 社会民主党宣言 |
7党→10党に増えているが、これは意図的に数を揃えたわけではなく、単純にこの11年で政党の顔ぶれがそれだけ増えたということでもある(詳しくは後述)。
なお、当時あった民主党・維新の党・次世代の党は解党・改称を経て消滅し、代わりに国民民主党・れいわ新選組・参政党・日本保守党が新顔として加わっている。自民党・公明党・共産党・社民党は党名も綱領の骨格もほぼ当時のままだった。
2. 結果

党ごとの特徴を並べてみる。
・自民党
「国民」「主義」「立党」「社会」「日本」。11年前の記事でも「自民党と民主党の綱領では、党名に重みがあまりない」と書いたが、今回も党名そのものはトップ5に出てこない。1955年の立党宣言をほぼそのまま引き継いでいるため、「立党」という語が高スコアで残っているのが11年前にはなかった特徴。
・立憲民主党
「社会」「目指す」「支援」「進める」「図る」。名詞よりも動詞が上位に来るのが他党と違うところで、政策集そのままの「〜を進めます」「〜を図ります」という実務的な文体がそのまま反映されている。
・公明党
「公明」「人間」「人類」「主義」「生活」。11年前の記事で「『人間』『地球』とスケールが大きい」と評した傾向は健在で、「人類」「地球」レベルの言葉選びは2015年の綱領からほぼ変わっていない(実際、公明党の綱領自体が2015年からテキストとしてほぼ据え置きだった)。
・日本維新の会
「維新」「地方」「社会」「日本」「国民」。前身の「維新の党」(2015年)でも「地域」が出ていたが、道州制・地方分権を掲げる党のアイデンティティは一貫している。
・国民民主党
「生きる」「綱領」「社会」「国民」「基本」。綱領本文がそもそも短く(後述)、キャッチコピー「つくろう、新しい答え。」の「答え」もトップ10に入ってくる。
・日本共産党
「主義」「日本」「社会」「アメリカ」「民主」。11年前も「他の党とは明らかに雰囲気が違う」と評したが、今回も「アメリカ」「資本」「戦争」「軍事」といった独自の語彙が上位に来る、最も個性の強い綱領という点は変わらない。
・れいわ新選組
「新選」「決意」「規約」「綱領」「使命」。上位に固有名詞が来やすいのは綱領本文が108語(自立語トークン数、後述)と極端に短いため。実際の政策色は「補償」「廃止」「底上げ」「被曝」といった語に表れている。
・参政党
「参政」「作り」「自ら」「政策」「日本」。「〜づくり」を10並べた「十の柱」の構成がそのままスコアに出ている。
・日本保守党
「日本」「保守」「世界」「国民」「結党」。結党宣言の文体(「幕末」「列強」「国体」「欧米」「先人」といった歴史的な語彙)が特徴的で、tf-idf上もその色が強く出た。
・社会民主党
「社会」「人々」「民主」「主義」「実現」。「平等」「労働」「共生」「自然」といった伝統的な社会民主主義の語彙が並ぶのは11年前の社民党とほぼ同じ傾向。

今回、党ごとの結果を見ていて数値よりも先に目についたのが「綱領の分量」そのものの差だった。日本共産党(3,628語)と、れいわ新選組(108語)とでは30倍以上の開きがある。長ければ良い・短ければ悪いという話ではなく、「綱領で理念を語り尽くす党」と「綱領は簡潔にして政策カタログやSNSで具体を語る党」という、情報発信スタイルの違いがそのまま表れているように見える。11年前の7党はここまで極端な差はなかったので、これも2026年らしい変化の一つかもしれない。
3. 11年で「政党」そのものが激変していた話
今回、綱領を集めるだけのつもりが、途中から政党再編そのものを追いかける羽目になった。2015年当時は自民・民主の二大政党を軸にした構図が一応安定していたが、2026年9月現在は以下のような経緯をたどっている(すべて公開報道ベースで確認した事実関係)。
- 2025年10月21日、高市早苗氏が第104代内閣総理大臣に就任(憲政史上初の女性首相)。自民党と日本維新の会による連立政権が発足した。
- 同月、公明党が26年間続いた自民党との連立を解消。11月に「中道改革」の旗印となる5つの政策を発表。
- 2026年1月、立憲民主党と公明党の衆議院議員(合計166人)が離党し、新党「中道改革連合」を結成。高市政権・維新への対抗軸を掲げた。
- 2026年2月8日の第51回衆院選で自民党が戦後最多の316議席を獲得。中道改革連合は結党時167議席から49議席へと「記録的大敗」を喫した。
- 2026年8月31日、中道改革連合と公明党・立憲民主党の3党合流交渉が正式に決裂。
- 2026年9月、立憲系議員は分派して新党を、公明系議員は公明党への復党を選び、中道改革連合は資金整理のため国会議員1人を残す形で事実上解体した。
結党からわずか8か月あまりでの解体劇である。今回の分析では、この経緯を踏まえて「中道改革連合」を独立した分析対象には含めず、参議院・地方組織として存続を続けている立憲民主党・公明党それぞれの公式サイトの綱領を使っている。
この間、れいわ新選組は議席1となり会派が消滅し、日本保守党は衆議院0・参議院1議席にとどまる一方、参政党は保守層・無党派層の受け皿として存在感を強めた。11年前の記事で分析対象だった次世代の党は解党済みで、民主党という党名自体、もう政治の世界に存在しない。
正直なところ、tf-idfで綱領の単語を数えるより、この政党再編ドラマを年表にまとめるほうがよほど骨が折れた。
4. LLM時代の「政党をテキストで測る」研究
今回はネット検索にNotebookLM CLIのDeep Researchを使い、「tf-idfのような古典的テキスト分析が、LLM全盛の2026年にどう位置づけられているか」も調べてみた。すると、政治学・計算社会科学の分野で、まさにこのテーマを扱った研究が2025年に相次いで出ていることがわかった。
代表的なのが、Di Leoらが2025年に学術誌Political Analysisに発表した「Mapping (A)Ideology」という研究だ。GPT-3.5に欧州の政党名を2つずつ提示し「どちらがより右翼的か」を判定させ、その全ペア比較結果をブラッドリー・テリー・モデルという統計手法でまとめてイデオロギー・スコアを算出する。政党名と国名しか与えない「ゼロショット」の手法にもかかわらず、専門家調査(Chapel Hill Expert Survey)のスコアと高い相関を示したという。
また、BenoitとLaverによる研究では、LLMにマニフェスト全文を読ませて「各政策課題をどれだけ重視しているか」を測定させている。単純に0〜10点で採点させるのではなく、全課題の合計が必ず「1.0」になるよう配分させる「サリエンス予算」という制約を課すことで、専門家の判断に近い結果が得られるという。
従来手法との比較をまとめると、次のような整理になる(NotebookLMのDeep Researchで収集した文献をもとに筆者が要約)。
| 特徴 | エキスパート調査(CHESなど) | マニフェスト・コーディング(tf-idf的手法を含む) | LLMによるアプローチ |
| コスト | 高い(専門家への謝礼等) | 高い(訓練されたコーダーが必要) | 非常に低い(API利用料のみ) |
| 所要時間 | 数ヶ月〜数年 | 数ヶ月 | ほぼリアルタイム |
| 再現性 | 低い(回答者の主観) | 中程度(コーダー間の差異) | 高い(同一プロンプトなら再現しやすい) |
この整理でいうと、今回筆者がやったtf-idf分析は表の真ん中「マニフェスト・コーディング」寄りの手法にあたる。11年前も今回も、コーダーの代わりに機械的な頻度計算を使っているという点では地続きだ。
ちなみに今回、10政党の左右位置をLLMに判定させる、という上記研究の追試のようなことも一瞬考えたが、やめておいた。日本の政党を「どちらが右翼的か」とAIにペア比較させて記事に載せる行為は、tf-idfで単語の出現頻度を数える行為とは重みがまるで違う。学術研究の枠組みでは意義があっても、個人ブログで独自の政党格付けを公開するのは筋が悪い。今回はあくまで「そういう研究がある」という紹介にとどめておく。
今後・まとめ
11年前の記事は「文章数が7つと少なかったので、今度は100個以上の文章で試してみたい」という予告で締めくくっていた。今回は10党どまりで、結局100個には遠く及んでいない。ただ、11年経ってわかったのは、「文章の数を増やす」よりも「分析対象そのものが時間とともに崩れて作り直される」ことのほうが、はるかに厄介だということだった。政党は法人のように安定した存在ではなく、綱領という「その時点での自己紹介文」も数年単位で書き換わっていく。tf-idfのような手法は、そういう動く標的を定点観測するにはむしろ向いているのかもしれない。計算コストがほぼゼロで、11年前と同じスクリプトの延長線上で今回も再現できたからだ。
一方で、LLMによる政治テキスト分析はこの数年で急速に実用段階に入りつつあるらしい。ゼロショットで専門家調査に迫るスコアを出せるとなると、tf-idfのような頻度ベースの手法は「解釈しやすく、無料で、誰でも再現できる」という美点だけが残っていく気がする。次に同じテーマを書くとしたら、11年後ではなくもっと早いサイクルで、「あの政党の綱領、AIにどう読まれているか」を確かめることになりそうだ。

