AIで古い本と手書きの文書を読む|国会図書館・くずし字・博物館・公民館の取り組み

古い本や手書きの文書を、AIで読めるようにする取り組みが広がっています。図書館(Library)だけでなく、博物館・美術館(Museum)、文書館(Archives)、公民館(Kominkan)でも同じです。この4つは頭文字をとって「MLAK(エムラック)」と呼ばれます。2011年の東日本大震災のあと、被災した施設を支えるボランティア活動「saveMLAK」で使われ始めた呼び方です。

この記事では、MLAKでのAIの使い方を、古い資料を読む話を中心にまとめました。古い本や地域の歴史に興味がある人、調べものが好きな人に向けた記事です。事例は2026年10月6日に資料で確かめました。

いちばん身近なのは、家から使える国立国会図書館デジタルコレクションです。使い方を知るなら、小林昌樹さんの『もっと調べる技術』が手がかりになります。第1講が「NDLデジタルコレクションは国会図書館のDXである」で、2022年末のリニューアルを、家族の歴史や官報の調べ方とあわせて解説しています。

『もっと調べる技術 国会図書館秘伝のレファレンス・チップス2』の表紙

もっと調べる技術 国会図書館秘伝のレファレンス・チップス2

小林昌樹(皓星社、2024年)

国会図書館の古い本は、文字認識で本文まで検索できる

国立国会図書館は、2022年12月21日にデジタルコレクションを新しくしました。このとき、本文まで検索できる資料が約5万点から約247万点に増えています。図書が約97万点、雑誌が約133万点、博士論文が約15万点などです。

これを支えているのが、国会図書館が自分で作った文字認識(OCR)のソフト「NDLOCR」です。スキャンした本の画像から文字を読み取り、検索できるテキストにします。おもな対象は、明治以降に活字で印刷された本です。

2026年2月24日には、軽くした「NDLOCR-Lite」が公開されました。画像処理用の装置(GPU)を積んでいない家庭用のパソコンでも速く動き、Windows・Mac・Linux用のアプリがあります。英語や手書きの文字にも試験的に対応しました。ライセンスはCC BY 4.0で、商用でも使えます。

国会図書館の実験サービス「次世代デジタルライブラリー」には、2025年12月に「テキストモード」が加わりました。昔の本の画像の代わりに、読む順に並べ直した本文を横書きで表示します。旧字の多い本でも、ふつうのWebページのように読めます。

くずし字は、スマホのカメラで読める

江戸時代以前の本や手紙は、くずし字で書かれています。今は読める人が限られていて、多くの資料が読まれないまま残っています。

人文学オープンデータ共同利用センター(CODH)は、2021年8月にAIくずし字認識アプリ「みを(miwo)」を公開しました。資料をカメラで撮ってボタンを押すと、AIが数秒でくずし字を今の文字に直します。約100万文字のくずし字データを学習していて、iOS版もAndroid版も無料です。

2022年10月の発表では、ダウンロード数は約10万件でした。くずし字を読めない人だけでなく、くずし字に慣れた専門家も、現地で中身をざっと確かめる「下読み」に使っているそうです。博物館や図書館が資料の中身をつかんだり、市民が地域の歴史を読み解いたりする場面でも使われています。

文書館では、100万点の手書き文書が検索できるようになった

スウェーデン国立公文書館は、2025年4月28日に、約100万点の手書き文書をAIで検索できるようにしたと発表しました。手書きの資料向けに作られたAIモデル「Swedish Lion」で、17〜18世紀の文書をテキストにしています。2025年中に、さらに数百万点を処理する予定とされていました。

日本では、全国歴史資料保存利用機関連絡協議会(全史料協)が、2025年8月5日に「アーカイブズにおけるAI活用」をテーマにオンラインのサロンを開きました。全史料協の催しでAIを本格的に扱ったのは、これが初めてです。

この会では、記録がデジタル化されてWebで公開されていなければ、AIを使う未来の研究者にとって無いのと同じになるかもしれない、という問題提起もありました。文書館がAIを使うだけでなく、AIに読まれる前提で記録を残す必要がある、という見方です。

開けない巻物の題名を、AIで読んだ

本を開かずに読む、という例もあります。西暦79年のヴェスヴィオ火山の噴火で炭になった、ヘルクラネウムの巻物です。開こうとすると崩れてしまうため、長いあいだ中身が分かりませんでした。

巻物をX線でスキャンし、その画像から機械学習で文字を見つける「Vesuvius Challenge」というコンテストが続いています。2025年5月には、封じられたままの巻物「PHerc.172」から、題名と著者が初めて読み取られました。哲学者フィロデモスの『悪徳について』です。見つけたのはドイツ・ヴュルツブルク大学の研究者2人と、コンテスト側の1人で、賞金は6万ドルでした。

100万冊近い古い本が、AIの研究用に公開された

著作権の切れた本983,004冊のテキストをまとめた「Institutional Books 1.0」が、2025年6月に公開されました。もとはハーバード大学の図書館の蔵書です。2006年に始まったGoogleブックスのスキャンで電子化された本で、254の言語にわたります。

データはHugging Faceで公開されていて、使えるのは非商用の目的にかぎられます。AIを作るには大量の文章が必要です。図書館の側が、出どころと権利の状態がはっきりした本のデータを用意した例といえます。

博物館では、展示図録がAIの答えの元になる

浜松市博物館は、2025年8月31日に「はまはくAI」というチャットボットを公開しました。2022年の特別展「三方ヶ原の戦いと家康伝承」の展示図録を読み込ませ、質問への答えを図録から作るしくみです。

ふつうの生成AIは、インターネット上のいろいろな情報から答えを作ります。はまはくAIは、博物館が調べてまとめた図録だけを情報源にしています。市の発表では、過去の展示図録で生成AIを使う取り組みは国内で初めてとされています。静岡大学情報学部と、株式会社NXワンビシアーカイブズとの共同の取り組みです。

公民館は、AIに触れる最初の場所になっている

公民館は、資料を持つというより、地域の人が学ぶ場所です。ここでは生成AIの入門講座が増えています。

千葉県君津市の公民館は、2025年度に「公民館×AI」というシリーズを組みました。2025年11月15日には周西公民館で、子どもが生成AIを使い始めたら大人はどう向き合えばよいかを考える講演会を開いています。会場に来られない人は、ほかの公民館のサテライト会場や自宅から、オンラインで参加できました。

福岡市の入部公民館でも、2026年7月8日に「はじめての生成AI体験講座」が開かれました。GeminiやChatGPTを実際に触ってみる講座です。アメリカの図書館の高齢者向け読書会と同じく、身近な施設がAIに慣れる場所になっています。

本を読む側のAIも、少しずつ増えている

資料を持つ側だけでなく、読む人の手元にもAIが来ています。Kindleでは2025年4月、シリーズものの前の巻のあらすじをAIで作る「Recaps」が端末に入りました。2025年12月には、読んでいる本について質問すると、読んだところまでの範囲で答える「Ask this Book」が発表されています。

ただ、どちらも発表の時点では英語の本が対象でした。Ask this Bookは、アメリカのiPhoneアプリから始まっています。2026年10月の時点では、日本ではどちらもまだ使えません。Ask this Bookについては、作家や出版社が自分の本を対象から外せないことに反発があったとも報じられています。

今のKindleで読む環境を整えたい人は、Kindle全機種の比較を参考にしてください。

次に読むなら

図書館が本探しにAIをどう使っているかは、図書館のAIは何をしている?にまとめました。古典を今の言葉で読みたい人には、源氏物語も平家物語も今の言葉で読めるもおすすめです。

参考にした資料

コメント

タイトルとURLをコピーしました