PDF 朗读为什么没反应

你打开 PDF,按了朗读,什么都没发生。应用没坏。很可能那个文件里根本没有东西可念。

中文的情况还多一个独立的原因:就算有文字,选中的语音也是错的。两件事得分开看。

第一个:扫描的 PDF 里没有文字

PDF 可以装两种完全不同的东西:文字,和图片。

用扫描或拍照做出来的 PDF,里面是一页一页的照片。眼睛看到的是字,文件里只有像素。朗读功能拿不到任何字符串。

同样的道理,搜索、选取、放大字号也都不动。一个不能用,其他通常也不能用。

两秒钟的检查

用手指选一句话试试。

能一个词一个词选起来,就有文字层。什么都选不中,或者整页像一张图被选中,那一页就是图片。

应用也会做粗略的检查:读前三页,如果加起来不到五十个字符,就提示这份文件看起来是扫描件。判据很粗,所以那是提醒,不是拒绝。

中华古籍资源库和各馆藏的旧籍几乎全在这一类。

还是想要文字的话

需要 OCR,也就是分析图像把字认出来,在电脑上做更现实。

中文 OCR 的准确度和原稿状态关系很大。竖排、异体字和老铅字都会拉低识别率,古籍尤其明显。

很多时候更短的路是去找同一本书已经排好的文字版。哪里找

第二个:中文书被英语语音朗读

这在文字层正常的 PDF 和 EPUB 上都会发生。要么没有声音,要么念出听不懂的东西。

原因不在文件而在应用。它选语音时看的是开头一段文字,而且只判断一件事:有没有越南语的声调符号。没有就设成英语。中文必然落在后者。

接下来就看语音引擎。有些会静静跳过不认识的文字,书一页页翻过去却没有声音;有些会硬用英语规则去念汉字。

应用里没有能改语言的设置。代码里有这个功能,但没有任何界面调用它。已经记录成问题,修好之前中文书的朗读指望不上。

按顺序检查

  1. 句子选得中吗。选不中就是扫描件。
  2. 选得中就说明有文字,剩下的是语音语言的问题。
  3. 可以去安卓的文字转语音设置看看有没有装中文语音,不过目前应用还是不会挑它。
所有文章