スマホ写真をAI検索で探す、数万枚でも迷わない仕組み
画像出典: パブリックドメイン(Wikimedia Commons)
スマホの写真検索は、AIが撮影時ではなく保存後に「何が写っているか」を解析し、顔・写り込んだ文字・被写体をそれぞれ別の仕組みで索引化することで成り立っています。顔のグループ化に名前を付ければ人物名で、写真内の文字はOCRの文字起こしで検索できます。仕組みが違う以上、得意な探しものと苦手な探しものもはっきり分かれます。
写真アプリの検索窓は、ファイル名を探しているわけではありません。スマホで撮った写真のファイル名は「IMG_4821」のような通し番号で、中身の手がかりを何も持っていません。それでも「看板」「レシート」「海」と打つと該当する写真が並ぶのは、保存されたあとにAIが1枚ずつ中身を見て、手がかりを付け直しているからです。
正直なところ、この仕組みを知らないまま使うと「なぜかこれは出るのに、あれは出ない」というもやもやが残ります。逆に、AIが何を索引にしているかが分かれば、探し方のほうを合わせられます。
AIは写真の何を見て検索できるようにしている?
撮影した瞬間に写真が持っている情報は、実はかなり乏しいものです。日時と、位置情報をオンにしていれば場所、あとはカメラの機種名くらい。「誰が写っているか」「何が写っているか」は、どこにも書かれていません。
ここを埋めるのが画像認識です。写真がクラウドや端末に保存されたあと、AIが画像を解析して、人の顔・写っている物・写り込んだ文字といった手がかりを抽出し、検索用の索引に足していきます。検索が速いのは、探すときに全部の写真を見ているのではなく、あらかじめ作っておいた索引を引いているからです。
大事なのは、この索引がひとつの仕組みで作られているわけではないという点です。顔には顔の仕組み、文字には文字の仕組みがあり、精度も限界も別物です。だから同じ検索窓に打ち込んでも、当たりやすい探しものと外れやすい探しものが出てきます。
人物で探す仕組み — 顔グルーピングとは?
Googleフォトには、自動で人物を認識して同じ人が写る写真をまとめる「顔グルーピング」があります。iPhoneの標準「写真」アプリにも、同じ役割の「ピープル」アルバムがあります。
ここでのAIの仕事は、名前を当てることではありません。写っている顔から特徴を数値の並びとして取り出し、その数値が近い顔どうしを同じ束にまとめることです。AIは「この束は同じ人らしい」までは自力でたどり着きますが、その人が誰なのかは知りません。
だから、束に人間が名前を付ける手順が用意されています。名前を付けた人物の写真は優先して表示され、以降は名前で呼び出せるようになります。ここが人物検索の要で、名前を付けていない状態では「顔の束」があるだけです。
- 顔グルーピング(ピープル)の一覧を開く
- よく撮る家族・友人の束に名前を付ける
- 同じ人が複数の束に分かれていたら統合する
- 以降は検索窓に名前を打つだけで呼び出せる
名前を付けておくと、もう一段便利な使い方ができます。Googleフォトでは名前を付けた人物どうしをスペースで区切って検索すると、その全員が一緒に写っている写真だけに絞り込めます。「子どもと祖父母が一緒に写った写真」のような、目で探すと一番つらい条件がひと息で片づきます。
人物認識が苦手なのはどんな写真?
顔の特徴を数値として比べる以上、比べる材料が乏しい写真は苦手です。横顔、マスクやサングラス、逆光でつぶれた顔、遠くの小さな顔。人間なら服装や場面の記憶で補えるところを、AIは顔の見え方だけで判断しています。
成長による顔立ちの変化も同様で、乳児期と数年後が別の束に分かれることは珍しくありません。これは不具合ではなく、同一人物かどうかを見た目の近さだけで決めている仕組みの帰結です。束が分かれていたら手動で統合する——その一手間が前提の機能だと思っておくほうが、うまく付き合えます。
なお精度は年々上がっています。iPhoneの顔認識はiOS 10当初こそ誤認識が目立ちましたが、その後端末プロセッサーの進化で機械学習の処理が高速化し、端末内でも高速かつ正確に顔を識別できるようになったと報告されています。顔を判定する計算そのものを端末の中で完結させられるようになったことが、精度と、写真を外に出さずに済むという安心の両方につながっています。
写真の中の文字はどうやって検索できる?
看板、レシート、ホワイトボード、名刺、薬の説明書。「文字を写しただけの写真」は、探すのが一番つらい部類です。ところがGoogleフォトは、写真の中に写り込んだ文字をOCR(画像から文字を読み取ってテキストに変換する処理)でテキスト化しており、その文字で検索できます。
つまり、写真は保存された時点で「見えない書き起こし」を一枚持たされている状態になります。ファイル名でもカメラ機種名でも説明文でもなく、写真の中の文字そのものが検索対象になっている、というのがここでの肝です。ある単語を含む写真だけを厳密に出したいときは、引用符で囲むと完全一致で検索できます。
この機能は2019年8月に発表された当初は英語のみの対応で、その後多言語への対応が進んできました。日本語の写真で試すときに、印刷された文字と手書きの文字とで手応えが違うのは、この積み上げの途中にいるからでもあります。
OCRは「画像として写っている文字の形」を読み取る処理です。ピントが甘い、斜めから撮って文字が歪んでいる、崩した手書き、装飾の強いロゴ書体は、読み取り結果が実際の文字とずれます。そしてずれたまま索引に入るので、正しい語で検索しても出てきません。後で探すつもりの書類や看板は、正面から・明るい場所で・文字が枠に収まるように撮る。撮り方のほうを検索に寄せるのが、一番確実な対策です。
被写体や場所で探すときはどう頼めばいい?
人物と文字のほかに、写っている物そのものを手がかりにする経路もあります。Googleフォトでは、人物・被写体・撮影場所・日付などを自由な文章で組み合わせて検索できます。「去年の夏に海で撮った写真」のような、条件をまたいだ指定ができるということです。
ここで効いてくるのが、最初に触れた「索引が別々に作られている」という話です。人物名は顔グルーピングの索引、場所は位置情報、日付は撮影時刻、被写体は画像認識——出どころの違う手がかりを、検索のときに重ねている。だから条件を足すほど絞り込みは効きますが、どれかひとつの索引が欠けているとヒットしません(位置情報をオフで撮った写真は、場所では永久に出てきません)。
- まず一番確実な手がかりから打つ名前を付けた人物名、写り込んでいたはずの文字など、索引が確実にある情報を最初に置きます。
- 絞りきれなければ条件を足す年・季節・場所を追加して範囲を狭めます。ここで急に0件になったら、足した条件の索引が無い可能性が高いところです。
- 0件なら条件を減らして言い換える「運動会」より「体操服」、「旅行」より「駅」。AIが見たままの物の名前に寄せると当たりやすくなります。
目の前の物を調べたいときはGoogleレンズ
すでに撮った写真から探すのではなく、いま目の前にある物を手がかりにしたいときは、Googleレンズが向いています。写真やカメラに写っている文字・テキスト・画像を読み取って検索でき、植物や動物、建物・スポット、商品、料理やメニュー、名刺、バーコードやQRコード、外国語の翻訳、テキストの抜き出し、ファッション製品の検索まで対応します。
使い方は、Googleアプリの検索バーにあるカメラボタンを押し、被写体を枠に収めて撮影。画面下のタブ(翻訳・テキスト・検索・宿題・ショッピング・お店やスポット)から目的に合うものを選びます。紙の書類をその場でテキストに起こしたいときにも使えますので、あとで検索できる状態にしておきたい書類は、撮るついでにテキストを抜いておくと確実です。
役割の違いも整理しておくと迷いません。Googleレンズは総合力が高く日常の物調べやテキスト抜き出しに向き、iPhone写真アプリのピープル機能は人物や場所ごとの分類・検索に強く、端末内処理でプライバシーに配慮されている——という比較がなされています。外の世界を調べるのがレンズ、手元の写真を秩序立てるのがピープルや顔グルーピング、と分けて考えるのが実際的です。
そもそも、写真は何枚たまるもの?
「自分だけためすぎでは」と感じている人もいるかもしれませんが、量が増えているのは全体の傾向です。MMD研究所と日本フォトイメージング協会の共同調査(2021年2月5日〜7日実施、予備調査2,000人・本調査800人、15〜69歳でスマホでの撮影が月2〜3回以上の男女が対象)では、スマホ本体に保存されている写真は平均1,032.9枚でした。
同種の調査では、別の年に平均1265.7枚、さらに別の年には1411.8枚と報告されており、年々増える傾向が見て取れます。規模の話をすると、Googleフォトは2025年5月30日時点で10周年を迎え、月間15億人以上が利用し、保存されている写真・動画は合計9兆枚を超えると発表されています。
この数字が示しているのは、「あとで整理する」が現実的でなくなったということです。フォルダ分けは1枚1枚に人の手が要りますが、写真は撮った瞬間に増えます。手作業が追いつかない量になった時点で、勝負は「整理してあるか」ではなく「検索で当てられるか」に移っています。
今日からできる、探せる状態の作り方
やることは多くありません。索引の性質に合わせて、下ごしらえと撮り方を少し変えるだけです。
- 顔グルーピング/ピープルを開き、よく撮る人に名前を付ける
- 同じ人が分かれている束を統合する
- あとで探す予定の書類・看板は、正面から明るく撮り直す
- 場所で探したい写真は、位置情報をオンにしてから撮る
- 検索は「人物名」「写り込んだ文字」から始める癖をつける
それでも見つからない写真は必ず残ります。顔が写っていない、文字も入っていない、位置情報もない——手がかりの索引がどれも無い写真は、AIにとって取っかかりがないからです。そういう1枚は、日付から絞って目で探すのが結局は早い。全部をAIに任せる前提ではなく、AIが強いところだけ任せるという線引きが、いちばんストレスが少ない使い方です。
数万枚を前にすると途方に暮れますが、全部を片づける必要はありません。よく探す人の名前を数人分付ける。それだけで、探せる写真の割合はかなり変わります。まずはそこから試してみてください。
よくある質問
AIの写真検索は、フォルダ分けをしなくても使えますか?
使えます。GoogleフォトやiPhoneの写真アプリの検索は、フォルダ構成ではなく、AIが写真を解析して作った索引(顔・写り込んだ文字・被写体・撮影日時・位置情報)を引いて動くためです。フォルダ分けをしていない数万枚のライブラリでも、人物名や写真内の文字で絞り込めます。
写真に写っている文字で検索できるのはなぜですか?
Googleフォトが写真内の文字をOCRでテキスト化して索引に持っているためです。ファイル名やカメラ機種名、説明文に加えて、写真内に写り込んだ文字そのものが検索対象になります。ある語を厳密に含む写真だけを出したい場合は、検索語を引用符で囲むと完全一致で検索できます。なおこの画像内テキスト検索は2019年8月に発表され、当初は英語のみの対応でした。
顔認識で同じ人が別々にまとめられてしまうのは故障ですか?
故障ではありません。顔認識は写っている顔の見た目の特徴を比べて同じ束にまとめる仕組みのため、横顔・マスク・逆光・成長による顔立ちの変化などで特徴が離れると、別の束として扱われることがあります。同一人物だと分かった束は手動で統合し、名前を付けておけば以降はその名前で検索できます。
複数の人が一緒に写っている写真だけを探せますか?
探せます。Googleフォトでは、顔グルーピングで名前を付けた人物どうしをスペースで区切って検索すると、その複数人が一緒に写っている写真だけに絞り込めます。前提として、対象の人物それぞれに名前を付けておく必要があります。
※記事で使用した内容・数値は変更される場合があります。最新情報は公式サイトをご確認ください。