python下载百度⽂库收费⽂档_GitHub-
lixudong62BaiduWenkuD。。。
css好看的边框样式格格百度⽂库下载程序1.0 及2.0
前⾔
总体⾔之,此软件功能相较于已有的冰点⽂库,最⼤创新点可能在于我先实现了多线程的批量下载。 ⼤部分功能也来⾃于我之前爬⾍实习积累的经验。
最后考虑更好⽤户交互性,我开发2.0带GUI界⾯的版本。这个过程同时解决了很多未知的技术和微⼩bug,所以还是耗费我的⼀段时间⼼⾎和劳动⼒。
基于崇尚互联⽹⾃由和分享的精神,源代码和软件都全部放出。但希望后来使⽤和学习者能注明出处,尊重原创!。
2018年,对于很多⼈是不平凡的⼀年,在快到来的12⽉⾥,希望你⼀切顺利~
最后如果觉得对您有帮助,欢迎github Start 加Fork。
还有更多使⽤细节和问题反馈可以github issues
百度⽂库下载器1.0说明
程序运⾏注意
dedecms更改模版运⾏该程序,必须保证电脑⾥⾯有Firefox浏览器。
同时在运⾏该程序时,尽量不要打开和操作⽕狐浏览器(Firefox)。
实现的意义
⽀持对百度⽂库能浏览的学习,资料,⽂章(pdf,word,txt,ppt)便利(免登陆,消费劵)和稳定的(⽀持复杂图表word⽂档)的下载到本地,并应对⼤量的⽂章⽀持多进程⾼效的批量下载。
声明:本程序原理仅是模拟浏览器截图到本地,开放的初衷是⽅便使⽤者下载⽂档资料到本地离线学习使⽤,⽆盈利⽬的,更请勿利⽤此程序下载的⽂档牟取盈利。同时百度⽂库上⽂档也都是百度账号的⽤户⾃愿上传,不存在侵权⾏为。
实现的主要功能
将多张图⽚合成pdf⽂件。
⽂件下载到本地的路径可⾃由设置。
对下载PDF⽂件,可设置其分辨率的⼤⼩即⽂件⼤⼩。
word,pdf⽂件,下载为超⾼清的pdf⽂件;txt⽂件,还原下载为txt⽂件。ppt⽂件,下载为⾼清图集。
对多个⽂件实现多进程的批量下载,可设置多进程同时下载的进程数(默认为4),极⼤加快⼤量⽂件下载速率和和简化了操作。
加⼊sqlite3数据库,对下载的历史记录进⾏保存,删除,⽅便回顾。
与他⽂库下载器和爬⾍程序的对⽐
优点:
相⽐Github上⽬前其他爬⽂库程序,它们简单只对txt,word等⽂档只有⽂字内容的解析,遇到带有格式或者表格的⽂档⽆法还原,⼏乎没有做什么处理。⽽此程序完美的还原word,pdf,ppt,txt,⽂档。
⽬前⽹络上类似⽂库爬取⽂档下载的软件⼝碑最好是冰点⽂库,相⽐冰点⽂库,实现了和它⼀样的技
术同时也先实现多进程的批量下载,完善⾼效的下载功能。
相⽐冰点⽂库的⼴告,此程序原创,⽆⼴告,绿⾊,安全。
缺点:
冰点⽂库已经有很长迭代式开发周期,功能更完善,运⾏更稳定,⼏乎⽀持所有的主流⽂库,相⽐之下此程序⽀持⽹站⽬前只有百度⽂库。
冰点⽂库使⽤C语⾔进⾏开发,程序运⾏效率好于此程序。
⽬前有待改进地⽅
设计⼀个简洁(陋)的UI界⾯,使交互更友好。(2.0版本写了⼀个窗⼝,提升交互性,易⽤性)
⽀持对其他开放的⽂库⽂档实现下载功能,⽐如知⽹,道客,360cc(待补充)。
多测试⼀下程序⼋阿哥(BUG),使其更稳定。
1.0主界⾯nginx 集部署
主界⾯部分功能的说明:
java权限控制框架
【2】.批量下载百度⽂库⽂档功能:
使⽤此功能前,需要编辑与软件同⼀⽬录的 ``````⽂件,没有则新建该⽂件,在⾥⾯写⼊需要批量下载⽹页链接,⼀⾏⼀个⽹页链接。
smart油车【3】.设置下载PDF⽂件分辨率:
不同分辨率的参数,决定下载下pdf⽂件的分辨率参数与⼤⼩,分辨率越⾼,⽂件越清晰,⽂件容量越⼤。
【7】.设置批量下载时多进程的数量
理论上,进程设置数最多为使⽤者电脑CPU的核数,保证同时有最多不同进程在同时下载不同⽂件,但考虑程序性能内存占⽤,推荐设置为4,表⽰批量下载时最多有四个不同⽂件同时下载。
格格百度⽂库下载程序2.0说明
在1.0⿊⽩Dos命令⾏运⾏界⾯基础上,利⽤PYQT技术撸了更为美观便于使⽤的界⾯。但由于没能解决PYQT⾥线程池的问题,2.0版本的批量下载是单线程按照队列顺序⼀个⼀个下载,批量下载速度没有1.0⾼效,其余功能都和1.0⼀样。具体请下载体验吧。
python教材下载
格格百度⽂库下载器2.0 程序主界⾯
格格百度⽂库下载器2.0 批量下载界⾯

版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系QQ:729038198,我们将在24小时内删除。