一个正文抽取的微服务,目前采用的算法是行块密度算法,大概测试了一下,可以抽取大部分的网页正文,但是效果还不是很理想,打算再用 Readability 再实现一遍。
项目用到了下面一下技术,感兴趣可以一起改进一下
1
kikyous 2015-11-09 16:52:58 +08:00
微信的优化阅读不知道用什么做的,效果很棒
|
2
domty 2015-11-09 16:54:42 +08:00
已 fork, 就当 spring-boot 学习教材了
|
3
ququzone OP @kikyous 微信的算法应该是参考了 Readability ,这个算法有 js 的实现,我打算转成 java 放到这个项目中
|
4
zts1993 2015-11-09 17:15:42 +08:00
看上去可以啊,回头看看
|