TAG / TOPIC

埋め込み

「埋め込み」に関するAIニュースと解説記事の一覧です。

04 STORIES

LATEST STORIES

埋め込みの新着記事

タグ一覧

RESEARCH / 04

Hugging Face、Sentence TransformersでMulti-Vector埋め込みの学習・微調整を本格対応 — 医療検索でNDCG 0.914、RTX 3090で14.5時間

Hugging Faceは2026年8月26日、Sentence TransformersでMulti-Vector Embeddingモデルの学習と微調整を体系化したガイドを公開。著者Tom AarsenがMIRIAD医療データでの再現レシピを示し、RTX 3090単体で14.5時間の学習で医療検索のNDCG@10を0.91超へ押し上げた。Late Interactionの優位性を50超のモデル比較で示す。

PRODUCTS / 03

Sentence Transformers v6.0、4番目のモデル型「MultiVectorEncoder」— ColBERT式のレイトインタラクション検索をネイティブ対応

Hugging Faceは2026年8月18日、Sentence Transformers v6.0を公開した。従来のdense・sparse・rerankerに加え、トークンごとに1ベクトルを保持してMaxSim演算でスコアするレイトインタラクション(ColBERT式)検索を扱う新モデル型MultiVectorEncoderを追加。PyLate・Stanford-NLP ColBERT・ColPali系のチェックポイントを直接読み込める。同データで訓練したLateOn(マルチベクター)とDenseOn(単一ベクター)の比較では、13データセットのNanoBEIRのうち9件と平均で勝ち、BEIR全体でも57.22対56.20と僅差の優位。一方でインデックスはMiniLM比で約42倍のストレージになる。内容はHugging Face公式ブログに基づく。

PRODUCTS / 03

「分類するな。幻覚させろ」— LLM分類を安くする「仮想分類→埋め込み解決」パターンが注目

LLMで大規模な分類語彙に出力を制約する際、構造化出力で全語彙を送る従来方式はプロンプト肥大・上限・コストが課題になる。Doug Turnbull氏が公開した「Don't classify. Hallucinate!」は、小型LLMに仮想的な分類を生成させ、実在分類の埋め込みインデックスとの類似度で解決するパターンを提案する。一次情報に基づいて整理する。

PRODUCTS / 03

AI2「OlmoEarth Studio」、地球観測の埋め込みベクトルを書き出せるように — 類似性検索・数ピクセルからのセグメンテーション・変化検出に対応

AI2(Allen Institute for AI)が2026年8月12日、地球観測モデル構築プラットフォーム「OlmoEarth Studio」で埋め込みベクトルの計算・エクスポート機能を発表した。エンコーダの選択肢、出力形式、応用例を一次情報に基づいて整理する。