産業技術総合研究所,筑波技術大学,東京大学,科学技術振興機構(JST)

2026(令和8)年9月25日

産業技術総合研究所
筑波技術大学
東京大学
科学技術振興機構(JST)

合成音声読み上げ時の音声情報理解力を定量化

~視覚障害者一人ひとりに「ちょうどいい」読み上げ速度を提供するために~

ポイント

産業技術総合研究所 人間社会拡張研究部門 三浦 貴大 上級主任研究員と、筑波技術大学 坂尻 正次 教授ら、東京大学 先端科学技術研究センター 藪 謙一郎 特任研究員らは共同で、視覚障害者の音声理解能力を定量化する手法を開発しました。

スクリーンリーダーは、パソコンやスマートフォンの文字情報を速度調整可能な合成音声で読み上げるためのソフトウエアです。それは、視覚障害者の就学や就労、社会参加を支える情報アクセシビリティーの基盤となっています。スクリーンリーダーを使用して音声を理解できる速度には個人差がありますが、その要因や音声理解の習熟過程はこれまで明らかになっていませんでした。

本研究では項目反応理論を応用し、読み上げられた文章が理解できなかった時、それは文章が難解だったからか、読み上げ速度が速すぎたからかを区別し、文章の難易度と利用者の理解能力を同じ指標で定量化する手法を開発しました。開発された評価手法を用いたところ、全盲の利用者は、弱視(ロービジョン)の利用者と比べ、より速い読み上げ速度でも高い理解を保つなどの科学的根拠を持つ知見が得られました。本成果は、視覚障害の状況や利用経験による個人差を分析し、音声理解の習熟過程や能力向上の可能性を評価するための基盤データとなり、「速すぎて聞き取れない」「遅すぎてもどかしい」という不便を減らし、視覚障害のある人がより快適に、より速く情報にアクセスできる環境作りにつながると期待されます。

本研究成果は、国際会議「Interspeech 2026」(2026年9月27日~10月1日、オーストラリア シドニーで開催)で発表予定です。

<本研究を支援したJSTの制度>

創発的研究支援事業

<論文タイトル>

“Profiling Speech Rate Abilities of Visually Impaired Screen Reader Users by Bayesian Item Response Theory”

<プレスリリース資料>

前に戻る