「AIマーケティングの始め方」という記事がWeb上に1,000本あったとします。 URLはそれぞれ異なりますが、AIにとっては「ほぼ同じ情報」として処理されます。
AI検索で引用されるのは、そのうちの1本だけです。 残りの999本は、どれだけ丁寧に書かれていても無視されます。 この記事では、なぜそうなるのか、そしてどうすれば「引用される1本」になれるのかを解説します。
AIはコンテンツの「意味の近さ」を数値で測っている
AIがコンテンツの類似性を判定する技術の核にあるのが「エンベディング」です。 テキストを数百次元の数値ベクトルに変換し、意味が近い文章ほどベクトルの向きが近くなる仕組みです。
たとえば「マーケティング戦略の立て方」と「マーケティング施策の設計方法」は、人が読んでも似た内容ですが、AIも同様にこの2つを「ほぼ同じ意味」と判定します。 この判定は「コサイン類似度」という指標で数値化されます。
コサイン類似度の目安は以下のとおりです。
| コサイン類似度 | 意味 |
|---|---|
| 0.9以上 | ほぼ同じ内容 |
| 0.7〜0.9 | 関連する内容 |
| 0.5未満 | 異なる内容 |
Reimers & Gurevych(2019年、TU Darmstadt)が開発したSentence-BERTにより、文単位の意味的類似度を高速に計算できるようになりました。 10,000件の文の全ペア比較が約5秒で完了します。
似た記事はLLMの学習データからも除外される
AIが似た記事を1つしか引用しないのは、検索の段階だけの話ではありません。 LLMの学習データを作る段階でも、意味的に重複するコンテンツは除去されています。
Lee et al.(2022年、Google Research)の研究では、LLMの主要な学習データであるC4コーパスに約3%、Wikiデータに約14%の完全一致の重複が含まれていたことが報告されています。 重複を除去したデータで学習したモデルのほうが、予測精度が向上し、暗記による偏りも減少しました。
さらに注目すべきは、Abbas et al.(2023年、Meta AI)のSemDeDup(意味的重複除去)の研究です。 完全一致ではなく、「言い回しが違うだけで中身が同じ」コンテンツをエンベディングの類似度で検出し、除去する手法です。
この研究では、学習データを約50%削減してもモデルの性能が維持または向上しました。 つまり、データの半分は「意味的に重複した冗長な情報」だったということです。
「AIが変えるマーケティングの未来」と「マーケティングにおけるAI活用の展望」は、表現は違いますが、SemDeDupでは重複と判定される可能性が高い内容です。
AI検索でも「似た記事は1つだけ」が選ばれる
PerplexityやChatGPT検索のようなRAGベースのAI検索では、ユーザーの質問に関連するドキュメントを検索し、その中からLLMが回答を組み立てます。
このとき、多くのAI検索システムはMMR(Maximal Marginal Relevance)という仕組みを使っています。 これは「質問との関連度が高く、かつ既に選ばれた記事とは違う内容のもの」を順番に選ぶアルゴリズムです。
似た内容の記事が上位候補に複数入っていても、実際に引用されるのは1件だけです。 残りは意図的に排除されます。
Tirumala et al.(2023年、Meta AI)のD4研究では、この原理をさらに踏み込んで分析しています。 特定のトピックに関する記事が1,000件あっても、情報空間上で同じ領域に集中している場合、実際に価値があるのは数十件程度だと示されました。
では、どんなコンテンツが「独自性がある」と判定されるのか
エンベディングの観点から、他の記事と異なるポジションを取れるコンテンツには共通する特徴があります。
独自のデータを含んでいる
自社のアンケート調査結果、実験データ、業績データなど、他のサイトには存在しない数値やファクトを含むコンテンツは、エンベディング上で異なる位置にマッピングされます。
「AI導入企業の割合は約30%」という一般的な数値を引用するだけでは、同じ数値を引用している他の記事と重複します。 「自社クライアント120社のうちAIツールを導入済みなのは47社(39%)、うち効果を実感しているのは28社」という独自データであれば、類似する記事はほぼありません。
具体的な事例を記述している
抽象的な概念の説明よりも、具体的な事例の記述のほうがエンベディング上で独自のポジションを取りやすいです。
「AIをマーケティングに活用する方法」は汎用的すぎて多数の類似記事と重複します。 「製造業B2B企業がチャットボットで展示会リード獲得率を改善した過程」は具体的で、類似記事が少なくなります。
複数の領域を横断している
単一トピックの記事は、同じトピックの他の記事と類似しやすい傾向があります。 2つ以上の領域を横断する記事は、エンベディング上でユニークな位置を占めやすくなります。
「SEO」単体の記事はWeb上に無数にありますが、「特許データベースのSEO」のように領域を掛け合わせるとニッチで独自性が高まります。 ただし、読者ニーズが存在するテーマであることが前提です。
独自の分析視点を持っている
同じデータを扱っていても、独自のフレームワークで分析している記事は別の位置にマッピングされます。
「日本のAI市場規模」を報じる記事は多数ありますが、「AI市場の成長が地方中小企業の採用戦略に与える影響」という切り口で分析している記事は少ないです。 後者はエンベディング上で独自のポジションを確保できます。
時系列データを蓄積している
定点観測データ(毎月のベンチマーク結果、四半期ごとの市場調査など)は、各時点のスナップショットがエンベディング上で異なる位置を占めます。 この種のコンテンツは時間の経過とともに独自性が増していきます。
自社コンテンツの独自性を確認する方法
コンテンツの独自性は、以下の方法で確認できます。
AI検索での実験。 PerplexityやChatGPTに、自社コンテンツに関連する質問を入力してみてください。 自社のコンテンツが引用されない場合、類似する他のコンテンツが既に引用されている可能性があります。
エンベディング検索ツールでの確認。 自社の記事タイトルやリード文をエンベディング検索ツール(OpenAIのEmbeddings APIなど)に入力し、上位に表示される競合記事との類似度を確認します。 コサイン類似度が0.9以上であれば、機械には「ほぼ同じ内容」と判定されています。
まとめ
AIは、テキストの意味をエンベディングという数値ベクトルに変換して類似性を判定しています。 この仕組みは、LLMの学習データ構築(Lee et al., 2022; Abbas et al., 2023; Tirumala et al., 2023)からAI検索のドキュメント選択まで、一貫して適用されています。
意味的に同じコンテンツは、1,000件あっても1件分の価値しかありません。 AI検索で引用されるには、エンベディング上で他の記事とは異なるポジションを占める必要があります。
独自データ、具体事例、領域横断、独自分析、時系列蓄積。 同じことを100回書くのではなく、他の誰も書いていないことを1回書く。 AI検索の仕組みは、この原則を技術的に裏付けています。