タグ: ローカルLLM

1 本の記事

プログラミング

ローカルRAGが遅いのはLLMじゃなく埋め込みだった話

ローカルでRAGを組んだときの「遅い・効かない」の原因が、生成LLMではなく埋め込みモデルの側にあった記録です。CPUでの `bge-m3` が1チャンク30〜60秒かかって大きな文書が入らなかった件、英語中心の埋め込みモデルで日本語検索が無言で0件になった件、そしてOllamaが2つ動いてポートを奪い合っていた件をまとめました。