概要
大規模言語モデル(LLM)が普及し,サービス価値やユーザ体験が変革の時を迎えています。チャットUIとしての印象が強いLLMですが,文献調査やコーディングの支援,果ては映画の編集など適用先は無限大に広がっています。とりわけ,テキストや画像,音声などこれまで扱いが難しかった非構造化データの解析に対して,LLMは極めて高い性能を発揮します。これらのデータの多くは企業や組織の中に手付かずのまま眠っていますが,その活用がビジネスでの競争力に直結するために,適切な形で情報を抽出する必要があります。このためLLMによる非構造化データからの情報抽出の取組みが活発化していますが,タスクの種類が多岐に渡ることや定量評価の難しさから教科書や論文での報告は多くはありません。そこで我々は,誰もが,どのような非構造化データであっても容易に分析できるように,一連のノウハウを体系的にまとめました。
本書ではまず非構造化データの特徴を述べ,情報抽出の重要さを説明します。次にLLMの特徴や性能向上のための技術を解説します。LLMは一見万能に見えますが,セキュリティの懸念,LLMが不得手とするタスク,処理速度,運用コスト,精度評価のむずかしさなど,適用時の注意点についてもふれます。そして,LLMによる情報抽出の汎用的な手法から,個々のタスクに特化した手法までを説明します。ただし,そのままのLLMでは各タスクに対する精度や処理速度が不十分なことがあります。タスクに対する精度を上げるために,画像の回転補正やマーカー付与,クレンジングやコンテキストの取捨選択といった前処理や,推論速度を高速化するための画像圧縮や複数画像の結合にLLMの出力を安定させ,後続の処理で使いやすくするためのバリデーションやリカバリといった後処理の技術についても解説します。
なお本書では,GoogleのGeminiを活用した情報抽出の手法を,詳細なプロンプトとともに解説しています。プログラミングに精通していない方でも,掲載しているプロンプトをコピー&ペーストするだけで,Geminiをはじめとする各種LLMで簡単に情報抽出を再現することが可能です。また,より高精度かつ発展的な推論を実現するために不可欠な前処理手法については,Pythonのサンプルコードを併記しました。これらはGoogle Colab環境でそのまま動作させることができ,すぐに実践に活かせるものとなっています。
こんな方におすすめ
- LLMを使って日常的なデータから情報抽出をしたい方