作者zcxcxc20002 (凌晨是我)
看板Web_Design
标题[问题] 爬动态资料问题
时间Mon Mar 2 14:30:25 2015
各位大大大家好,
爬网页资料很常被用来做一些资料搜集或整理上,
以前不管是使用DOM的比对或者是Regex来处理都还好处理,
但自从很多网页开始使用动态载入资料之後,原本的做法变得不可行。
不知道版有大大有没有相关资讯可以用来解决这样的问题?
是否要透过不一样的技术来搜集资料。?
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 140.122.184.47
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/Web_Design/M.1425277832.A.91F.html
1F:推 mmis1000: phantom js 03/02 15:52
2F:→ mmis1000: 要不然就自己解出ajax的网站模拟request 03/02 15:53
3F:→ mmis1000: 现在浏览器的开发者工具都有看request的功能 03/02 15:54
4F:→ guanting886: phantom +1,不过早期都是用C#+WebBrowser硬干 03/02 22:37
6F:→ zcxcxc20002: 谢谢各位大大提供,我也都用C#抓比较多 03/03 11:33
7F:→ slamgundam: 想问phantomjs可以操作linux换IP吗~? 03/04 09:36
8F:→ mmis1000: 你可以把他跟其他语言合用?像是nodejs就有phantom的 03/04 12:14
9F:→ mmis1000: bridge,phantom js本身也能单独拿来当server用 03/04 12:14
10F:→ mmis1000: phantom js本身应该没那些功能 03/04 12:15
11F:→ slamgundam: Ok,我再研究看看,感谢你~ 03/04 14:02
12F:→ best940070: 写浏览器套件去抓 03/20 23:03