
「会議のホワイトボードを撮影した写真から文字を抽出したい」「外国旅行先でメニューの写真を翻訳したい」「書類の画像データをテキスト化して編集したい」——こんな悩みを抱えていませんか?
写真から文字起こしをする需求は、ビジネスから日常生活まで幅広く存在します。会議の議事録作成、契約書類のデジタル化、旅行先での看板やメニューの翻訳など、活用シーンは多岐にわたります。2026年現在、AI-OCR技術の進化により、スマートフォンで撮影した写真から一瞬でテキストを抽出できるようになりました。精度も日本語認識精度95%以上を実現するツールが登場しています。
本記事では、写真から文字起こしをする方法を5つのアプローチで徹底解説します。iPhoneの内蔵機能からプロフェッショナルなAIツールまで、目的と予算に合わせた最適な方法が必ず見つかります。さらに、Felo字幕を活用した音声ベースの文字起こしアプローチもご紹介します。
本記事でわかること:
– 写真から文字起こしする5つの方法とそれぞれの特徴
– iPhone・Androidの内蔵機能だけで文字化する手順
– 書類、メニュー、看板などシーン別の最適なアプローチ
– AI-OCRツール選びのポイントと精度比較
写真から文字起こしとは
写真から文字起こしとは、スマートフォンやカメラで撮影した画像内の文字を、AI-OCR(光学式文字認識)技術を用いてデジタルテキストとして抽出する技術である。紙の書類、看板、メニュー、ホワイトボード、スクリーンショットなど、あらゆる画像に含まれる文字データを即座にテキスト化でき、手入力による転記作業を不要にする。
2026年現在、AI深層学習モデルの進化により、手書き文字、縦書き日本語、複数言語の混在、傾いた写真など、従来は困難だったシーンでも認識精度90〜95%以上を実現している。特に日本語については、漢字・ひらがな・カタカナの混在文の認識率が飛躍的に向上しており、実用レベルで活用できるツールが一般的になっている。
なぜ写真からの文字起こしで悩むのか——3つの原因
原因1:ツールの種類が多すぎて選べない
写真から文字を抽出できるツールは、iPhoneの内蔵機能、Google Lens、専用OCRアプリ、クラウドサービスなど数十種類存在します。それぞれ対応言語、精度、操作性が異なるため、「どれを選べばいいかわからない」という悩みがよくあります。
原因2:日本語の認識精度にばらつきがある
OCRツールの多くは英語を中心に開発されており、日本語の漢字や縦書き、ルビなどに対応していない場合があります。特に手書きの日本語や、撮影角度が傾いている写真では、文字化けや誤変換が頻発します。
原因3:抽出後のテキスト編集に手間がかかる
文字を抽出できても、レイアウトが崩れていたり、段落構成が失われたりして、結局手作業で修正することになります。抽出された文字列をそのまま議事録や報告書に使うには、追加の編集作業が不可欠です。
これらの課題を解決するために、以下では目的別に5つの方法を詳しく解説します。動画の文字起こしについて詳しく知りたい方も、本記事の知識と組み合わせることで幅広いシーンに対応できます。
Felo字幕なら、写真・音声あらゆるシーンの文字起こし課題を解決できます

方法1:iPhoneの「テキスト認識表示」機能を使う(無料・最速)
iPhoneに標準搭載されている「テキスト認識表示(Live Text)」機能は、追加アプリなしで写真から文字を抽出できる最も手軽な方法です。iOS 15以降のiPhoneであれば、すべての機種で利用できます。
手順
- ステップ1:iPhoneの「写真」アプリを開き、文字を抽出したい写真をタップする
- ステップ2:写真内の文字の上を長押しすると、テキスト選択モードが起動する。必要な範囲をドラッグで選択
- ステップ3:「コピー」をタップしてテキストをクリップボードに保存。メモアプリやメールに貼り付け
また、カメラアプリを開いた状態で画面内の文字を長押ししても、リアルタイムで文字を認識・コピーできます。看板やメニューを目の前にして即座にテキスト化したい場合に非常に便利です。
メリット・デメリット
- メリット:完全無料、アプリインストール不要、オフラインで動作、プライバシー安心
- デメリット:一度に大量の書類を処理できない、レイアウト情報が保持されない、手書き文字の精度に限界がある
この方法は、メニューの翻訳、看板の文字読み取り、スクリーンショットからのテキスト抽出など、日常的な軽作業に最適です。テープ起こしとはの基本を理解し、音声ベースの文字起こしと組み合わせることで、あらゆる情報収集の効率が劇的に向上します。

方法2:Google Lensで画像テキストを抽出する
Google Lens(グーグルレンズ)は、画像内のテキストを抽出するだけでなく、翻訳や検索まで一気に実行できる強力なツールです。iPhone・Androidどちらでも利用可能で、基本無料で使えます。
手順
- ステップ1:Googleアプリを開き、検索バーのカメラアイコン(Google Lens)をタップ
- ステップ2:「テキスト」モードを選択し、撮影済みの写真を選択するか、その場でカメラ撮影
- ステップ3:「すべて選択」で全文をコピー、または必要な部分だけを選択してテキスト化
- ステップ4:必要に応じて「翻訳」ボタンをタップし、90以上の言語にリアルタイム翻訳
Google Lensの最大の強みは、テキスト抽出後にそのまま翻訳やWeb検索にシームレスに移行できる点です。海外出張時の書類確認、外国語のメニュー読み取りなどに特に威力を発揮します。
メリット・デメリット
- メリット:無料、翻訳機能統合、多言語対応(90+言語)、Android・iOS両対応
- デメリット:インターネット接続が必須、Googleアカウントが必要、プライベートな書類の送信に抵抗感

方法3:AI-OCR専用アプリで高精度に抽出する
より高精度な文字認識が必要な場合、AI-OCR専用アプリを利用するのがおすすめです。書類のデジタル化、契約書のテキスト化、議事録用のホワイトボード撮影など、ビジネスシーンで特に有用です。
おすすめAI-OCRアプリ
- Microsoft Lens(無料):書類、ホワイトボード、名刺、レシートに最適化された撮影モードを搭帯。OCR結果をWordやPDFとして保存可能。縦書き日本語にも対応
- Adobe Scan(無料/プレミアム有料):高品質な画像補正とOCRを組み合わせ、歪みや影を自動補正してから文字認識を実行。PDFとテキストを同時出力
- CamScanner(無料/プレミアム有料):世界中で5億ダウンロード超。高解像度スキャンとOCR、クラウド同期に対応。チーム共有機能も充実
手順
- ステップ1:アプリをインストールし、撮影モード(書類、ホワイトボード等)を選択
- ステップ2:カメラで対象を撮影。自動的に縁を検出して台形補正を実行
- ステップ3:フィルタを適用して文字部分を鮮明化し、OCRを実行
- ステップ4:テキスト結果を確認・編集し、PDF、TXT、Word形式で保存・共有
ビジネス文書のデジタル化において、Premiere Proで文字起こしをする映像クリエイターも、画像ベースのOCRツールを併用することでワークフローの効率化が図れます。
方法4:クラウドAI-OCRサービスで一括処理する
大量の写真や書類を一括でテキスト化したい場合、クラウド型のAI-OCRサービスが適しています。API経由で数百枚の画像を自動処理でき、開発者向けのシステム連携も可能です。
主なクラウドAI-OCRサービス
- Google Cloud Vision API:画像内の文字検出(TEXT_DETECTION)に特化。80以上の言語に対応し、 handwritten(手書き)文字の認識精度も高い。1,000ユニット/月まで無料
- Amazon Textract:AWSのOCRサービス。フォーム、表、レイアウト構造を保持したままテキストを抽出。契約書や請求書の構造化に強い
- Azure AI Document Intelligence:MicrosoftのドキュメントAI。事前構築済みモデル(請求書、名刺、ID等)が豊富で、カスタムモデルも作成可能
クラウド型の特徴
- メリット:大量処理、API連携、レイアウト保持、高精度(96〜99%)
- デメリット:有料(従量課金)、プログラミング知識が必要、セキュリティ要件の確認が必要
方法5:音声ベースのアプローチ——写真+音声で完璧な文字起こし
写真からの文字起こしと並行して活用したいのが、音声ベースの文字起こしです。会議中のホワイトボードを撮影して文字を抽出するだけでなく、その会議の発言内容も同時にテキスト化しておけば、視覚情報と音声情報を組み合わせた完璧な議事録が作成できます。
ここで活躍するのがFelo字幕です。Felo字幕は、Zoom、Google Meet、Teams、Webexなどのオンライン会議でリアルタイムに文字起こしを実行し、20以上の言語を認識、90以上の言語に翻訳できます。

Felo字幕の主な機能
- リアルタイム文字起こし:会議の発言を即座にテキスト化。話者識別機能で「誰が発言したか」も自動記録
- 多言語翻訳:20以上の認識言語、90以上の翻訳出力言語に対応。国際会議でも活躍
- ボット不要:Botが会議に参加しません。システム音声をキャプチャする方式で、他の参加者に迷惑をかけません
- エクスポート:Text、SRT、PDF形式で出力。インタビューの文字起こしや会議議事録にそのまま活用できます
写真から文字を抽出する「視覚アプローチ」と、音声から文字を起こす「聴覚アプローチ」を組み合わせることで、情報の取りこぼしをゼロに近づけることができます。
写真から文字起こしする方法比較表
| 方法 | 精度 | 料金 | 対応言語 | 最適なシーン |
|---|---|---|---|---|
| iPhone テキスト認識表示 | 中〜高 | 完全無料 | 日本語・英語中心 | 日常的なメニューや看板の読み取り |
| Google Lens | 高 | 完全無料 | 90+言語 | 海外旅行、外国語の翻訳付き読み取り |
| AI-OCR専用アプリ | 高 | 無料/有料 | 多言語 | 書類、名刺、ホワイトボードの業務利用 |
| クラウドAI-OCR | 極高 | 従量課金 | 80+言語 | 大量書類の一括処理、システム連携 |
| Felo字幕(音声アプローチ) | 高 | $9〜/月 | 20+言語認識 | 会議の文字起こし、リアルタイム翻訳 |
シーン別おすすめアプローチ
ビジネス書類のテキスト化
契約書、提案書、会議資料などの紙書類をデジタル化する場合は、AI-OCR専用アプリがおすすめです。Microsoft LensやAdobe Scanを使えば、台形補正や影除去を自動実行し、クリーンなテキストデータとして抽出できます。機密文書の場合はオフライン動作するiPhoneの内蔵機能が安心です。
会議・打ち合わせの記録
会議中のホワイトボードやプレゼン資料を撮影するだけでなく、発言内容も記録したい場合は、Felo字幕が最適です。写真で視覚情報を、音声で発言内容を、それぞれ文字起こしすることで、完璧な会議記録が作成できます。Zoomの同時通訳機能と組み合わせれば、多言語会議にも対応できます。
海外旅行でのメニューや看板
海外旅行先でのレストランメニューや街中の看板は、Google Lensが圧倒的に便利です。テキスト抽出と同時に翻訳まで実行できるため、言語の壁を意識せずに現地の情報を入手できます。翻訳機おすすめについてさらに詳しく知りたい方もぜひ参考にしてください。

写真から文字起こしする際のコツ
写真から文字を高精度に抽出するには、撮影時の工夫が重要です。以下のポイントを押さえることで、認識精度を10〜15%向上させることができます。
撮影時のポイント
- 正面から撮影する:角度が傾くと認識精度が著しく低下します。可能な限り対象に正対して撮影
- 十分な光を確保する:暗い環境ではノイズが増え、文字認識が困難になります。照明を確保するかフラッシュを使用
- コントラストを高める:白い紙に黒い文字が最も認識精度が高いです。薄いペン書きの場合は、アプリの補正機能を活用
- 高解像度で撮影する:最小でも1080×1920ピクセル以上を推奨。小さな文字はズームアップして撮影
抽出後の編集のコツ
- 段落構造を維持したい場合は、レイアウト保持機能のあるツール(Adobe Scan、Azure Document Intelligence等)を選択
- 専門用語や固有名詞は、OCR結果の前後の文脈から判断して修正
- 表形式のデータは、表構造を認識できるツール(Amazon Textract等)を使用
写真の文字起こしに関するFAQ
Q1:iPhoneだけで写真から文字をコピーできますか?
A:はい、可能です。iPhoneの「テキスト認識表示」機能を使えば、写真アプリ内の画像から直接テキストをコピーできます。iOS 15以降の機種であれば追加アプリ不要で利用でき、完全無料です。カメラアプリでリアルタイムに認識することもできます。
Q2:手書きのメモでも文字起こしできますか?
A:できますが、精度は印刷文字より低くなります。2026年現在のAI-OCR技術では、丁寧な手書き文字であれば80〜90%の認識精度を実現します。Microsoft LensやGoogle Lensの手書き認識機能が比較的高精度です。ただし、走り書きや極端に崩れた文字の認識は困難です。
Q3:外国語の写真を翻訳付きで文字起こしするには?
A:Google Lensが最適です。テキスト抽出と同時に翻訳を実行でき、90以上の言語に対応しています。メニューや看板を目の前にして、リアルタイムで翻訳結果を画面に重ねて表示する機能(AR翻訳)も便利です。
Q4:大量の書類写真を一括でテキスト化できますか?
A:はい。クラウド型AI-OCRサービス(Google Cloud Vision API、Amazon Textract、Azure Document Intelligence等)を使えば、数百枚の画像を一括処理できます。API経由で自動化する仕組みを構築すれば、継続的な大量処理にも対応可能です。
Q5:Felo字幕で写真からの文字起こしはできますか?
A:Felo字幕の主な機能は音声ベースのリアルタイム文字起こし・翻訳です。写真からのOCRは主機能ではありませんが、会議中のホワイトボード撮影(視覚情報)とFelo字幕の音声文字起こし(聴覚情報)を組み合わせることで、包括的な会議記録が作成できます。動画に自動で字幕をつける方法についても参考にしてください。
Q6:写真から文字起こしする際のセキュリティは大丈夫?
A:機密性の高い書類を処理する場合は、iPhoneの内蔵機能(オフライン動作)を使用するか、エンタープライズ向けのセキュアなOCRサービスを選ぶことをおすすめします。クラウド型サービスを利用する場合は、データの暗号化、保管期間、利用目的を確認してください。
まとめ
写真から文字起こしする方法について、5つのアプローチを解説しました。
- iPhone テキスト認識表示:日常的な軽作業なら無料・最速で対応
- Google Lens:翻訳が必要な外国語写真に最適、90+言語対応
- AI-OCR専用アプリ:書類やホワイトボードのビジネス利用に
- クラウドAI-OCR:大量処理やシステム連携に強い
- Felo字幕(音声アプローチ):会議の文字起こし・翻訳に特化
目的とシーンに合わせて最適なツールを選ぶことが重要です。日常的なメニュー読み取りならiPhoneの内蔵機能で十分ですし、ビジネス書類のデジタル化ならAI-OCRアプリ、そして会議の記録ならFelo字幕と使い分けるのが効率的です。
写真からの文字起こしと音声からの文字起こしを組み合わせれば、あらゆる情報キャプチャのシーンをカバーできます。まずは無料で使えるツールから試してみて、必要に応じてより高度なツールへとステップアップしていきましょう。
