PDF下不下来?我来教你把永中文档转换服务里的文件扒下来

永中文档下载 ·
PDF下不下来?我来教你把永中文档转换服务里的文件扒下来

为什么要扒永中文档的转换服务

先说个真实场景。上个月我赶着交一份投标书,客户甩过来一个永中文档链接,里面是个PDF图册,但那个链接点进去只能在线看,想下载?得注册账号、买会员、再等什么转换配额。我当时的内心活动就是:我就想保存一个文件,至于绕这么大圈子吗?后来我发现,永中文档的在线转换服务其实是个“钓鱼台”——它把PDF转成图片或者网页格式让你浏览,但就是不给你直接下载原始文件。你看到的那个“下载”按钮,要么跳转到付费页面,要么提示“文件已过期”,要么干脆灰色不可点。这就是为啥今天我要写这篇东西,教你用点土办法,把那个服务里的文件实实在在地扒到你电脑上。别担心,不用学代码,不用装复杂软件,就靠浏览器和几个常识操作,我踩过的坑你大概率不用再踩。

全平台支持Win·Mac·手机持续更新紧跟官方新版本免费使用无需付费解锁

先搞明白永中文档的套路

你要想扒下来,得先知道对方在怎么藏。永中文档的常见套路是:你把PDF传上去,它后台拆分页面,每页生成一张高清图片或者一个SVG矢量图,然后嵌入到网页里用JavaScript控制翻页。你看到的“转换结果”,其实是一堆图片叠加的假PDF。它之所以不给你直接下,一是保护版权,二是逼你买会员。但这里有个漏洞:无论它怎么加密,最终用户眼睛看到的像素,都必须在你的浏览器里渲染出来。你只要能拿到浏览器渲染出来的那些图片,就能拼回原始PDF。我试过最笨的办法,就是手动截图每一页,但那太傻了。后来我用了几种工具,发现最靠谱的反而是浏览器自带的开发者工具,别被这个名字吓到,其实很简单。

用浏览器开发者模式扒页面的实操

第一步,随便哪个浏览器都行,Chrome、Edge甚至360极速模式,打开永中文档的那个在线预览页面。等所有页面加载完,按F12或者右键选“检查”,会弹出一堆代码界面。别慌,你找里面有个叫“Network”的标签,点一下,然后刷新页面。这时候你会看到下面刷刷刷冒出一大堆请求,有jpg、png、或者svg后缀的,那些就是每一页的图片文件。我习惯按文件类型过滤,点一下“Img”或者“图片”筛掉乱七八糟的JS和CSS。如果图片太多,你可以把页面翻到当前显示的那一页,然后在Network面板里看哪些图片大小在几十到几百KB之间,一般就是页面内容图。右键点那个图片链接,选“在新标签页中打开”,就能看到单独的一页内容。一页页这么存虽然慢,但胜在稳定。如果只有几十页,这办法完全可行。我这里有个小技巧:你先存一两页试试,看看文件名是不是有规律,比如page_001.jpg、page_002.jpg这种,如果是,那就能直接批量下载,后面讲。

批量抓取用油猴脚本或DownThemAll

如果那个PDF有三四百页,用手点就太自虐了。我推荐两种方式。第一个是油猴脚本,你在浏览器里装个Tampermonkey插件,然后去Greasyfork搜“永中文档下载”或者“PDF图片批量提取”,会有人写好的脚本。安装后,再打开永中文档的预览页,脚本会自动识别页面上的图片链接,并且在页面角落生成一个“下载全部”的按钮。点一下,图片就按照页码顺序开始下载了。我用过好几个脚本,有的稳定,有的跳页,建议你装评分高的,顺便看评论区有没有人说最新版本失效。失效也别急,换一个脚本或者自己简单改改——大部分脚本的逻辑都是读取网页里所有img标签的src属性,然后给它们加个下载队列。第二个工具是DownThemAll,这是个老牌火狐和Chrome的批量下载插件。打开预览页后,右键选DownThemAll,它会把页面上所有链接和图片都列出来,你按文件类型筛选,勾选所有图片,设定保存路径,一键下载。这个插件的好处是它自带重命名功能,比如你勾选了“自动按数字顺序命名”,它就能把图片按下载顺序改成001.jpg、002.jpg。缺点是有时候永中文档会搞随机文件名,那就只能靠时间去排了。我试过最极端的情况,一个600页的标书,用DownThemAll下完图片大概花了8分钟,还算能接受。

图片转PDF用哪个工具省劲

下载下来一堆图片之后,你肯定想合并成一个真正的PDF。Windows用户我推荐一个叫“PDF Shaper”的免费工具,或者直接用“Adobe Acrobat”也能合并,但那个要钱。如果你不想装软件,有个在线网站叫ilovepdf,选“图片转PDF”,把图片按顺序拖进去就行。但注意:在线工具有文件数量限制,一般免费版一次最多20页,你分几批弄完了再合并。我自己的习惯是用Smallpdf的桌面版,虽然不开会员有次数限制,但本地处理速度快且不担心隐私。还有一个偏方:如果你会用命令,Win10和Mac自带的打印功能也能做到。把图片全选,右键“打印”,在打印设置里选“Microsoft Print to PDF”作为打印机,纸张大小选原始尺寸,排版选“每版1页”,然后打印就能生成一个PDF。这个方法适合图片少于100张的情况,太多容易卡死。合并的时候注意顺序,很多下载器下载后的图片文件名是按数字排序的,但有的会乱序,你最好在文件夹里按“修改日期”或“名称”排序确认一下,再拖进工具。

遇到防盗链和动态加载怎么破解

说了这么多,实际上永中文档偶尔会升级防御。我遇到过最恶心的版本是:图片地址每隔几分钟就换一个token,你复制出来的链接过一会儿就失效。这种情况下,脚本和DownThemAll都白搭。我当时的解法是,用浏览器的“保留日志”功能,在Network面板勾选“Preserve log”,然后快速翻一遍所有页面,让浏览器把所有图片请求都记录下来。等全部翻完,Network面板里会保留所有已加载的图片信息,这时候你再逐个右键保存,或者用“Copy as cURL”命令导出链接列表,再写个简单批处理批量下载。这一步确实有点技术含量,但大部分普通用户不会遇到这种强加密。如果真遇到了,我建议你直接用“截图大法”做备选方案:把浏览器窗口调成全屏,用微信截图或者Snipaste,逐页截图保存。虽然麻烦,但至少能拿到东西。还有个邪门办法:用安卓模拟器在PC上安装永中文档的App,在App里打开文件,然后用模拟器的文件管理器或者投屏软件把缓存扒出来。这个我试过一次,太折腾,不值得推荐。

日常使用的避坑经验与版权提醒

最后说点实在的。扒文件这事,经常遇到文件明明在线能看,下载到本地后图片里出现水印或者永中的logo。那是因为源文件本身就被加了保护,你扒下来的只能是带水印的版本。如果你想清掉水印,那就得用PS或者去水印工具,又是一层功夫。我的原则是:如果文件只是内部参考,带水印也无所谓;如果是正式商用或者出版,还是老老实实买原始文件。另外,永中文档偶尔会检测到大量的非正常下载行为,然后封掉你的IP或者账号。所以你批量下载的时候,别开几十个线程同时拉,放慢速度,每两秒下一张都行。还有个小细节:下载下来的图片如果是黑色背景的扫描件,可能颜色反转了,你合并PDF前记得在PS里调一下黑度,否则打印出来看不清。我记着有一次赶项目,连夜扒了份合同,结果忘了调对比度,第二天打印出来全是灰底字,被领导骂了一顿。别学我。