PDF 朗读为什么没反应
你打开 PDF,按了朗读,什么都没发生。应用没坏。很可能那个文件里根本没有东西可念。
中文的情况还多一个独立的原因:就算有文字,选中的语音也是错的。两件事得分开看。
第一个:扫描的 PDF 里没有文字
PDF 可以装两种完全不同的东西:文字,和图片。
用扫描或拍照做出来的 PDF,里面是一页一页的照片。眼睛看到的是字,文件里只有像素。朗读功能拿不到任何字符串。
同样的道理,搜索、选取、放大字号也都不动。一个不能用,其他通常也不能用。
两秒钟的检查
用手指选一句话试试。
能一个词一个词选起来,就有文字层。什么都选不中,或者整页像一张图被选中,那一页就是图片。
应用也会做粗略的检查:读前三页,如果加起来不到五十个字符,就提示这份文件看起来是扫描件。判据很粗,所以那是提醒,不是拒绝。
中华古籍资源库和各馆藏的旧籍几乎全在这一类。
还是想要文字的话
需要 OCR,也就是分析图像把字认出来,在电脑上做更现实。
中文 OCR 的准确度和原稿状态关系很大。竖排、异体字和老铅字都会拉低识别率,古籍尤其明显。
很多时候更短的路是去找同一本书已经排好的文字版。哪里找。
第二个:中文书被英语语音朗读
这在文字层正常的 PDF 和 EPUB 上都会发生。要么没有声音,要么念出听不懂的东西。
原因不在文件而在应用。它选语音时看的是开头一段文字,而且只判断一件事:有没有越南语的声调符号。没有就设成英语。中文必然落在后者。
接下来就看语音引擎。有些会静静跳过不认识的文字,书一页页翻过去却没有声音;有些会硬用英语规则去念汉字。
应用里没有能改语言的设置。代码里有这个功能,但没有任何界面调用它。已经记录成问题,修好之前中文书的朗读指望不上。
按顺序检查
- 句子选得中吗。选不中就是扫描件。
- 选得中就说明有文字,剩下的是语音语言的问题。
- 可以去安卓的文字转语音设置看看有没有装中文语音,不过目前应用还是不会挑它。