<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Web Crawler on 瓶子裡的小狐狸</title>
    <link>https://szeching.com/tags/web-crawler/</link>
    <description>Recent content in Web Crawler on 瓶子裡的小狐狸</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>zh-Hant</language>
    <copyright>© 2026 Y Cheung</copyright>
    <lastBuildDate>Thu, 27 Nov 2014 00:57:49 +0000</lastBuildDate><atom:link href="https://szeching.com/tags/web-crawler/index.xml" rel="self" type="application/rss+xml" />
    
    <item>
      <title>罕见的网络爬虫</title>
      <link>https://szeching.com/rare-web-spider/</link>
      <pubDate>Thu, 27 Nov 2014 00:57:49 +0000</pubDate>
      
      <guid>https://szeching.com/rare-web-spider/</guid>
      <description>&lt;p&gt;看网站LOG信息有奇怪的东西混入：&lt;/p&gt;&#xA;&lt;div class=&#34;highlight-wrapper&#34;&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-text&#34; data-lang=&#34;text&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;ln&#34;&gt;1&lt;/span&gt;&lt;span class=&#34;cl&#34;&gt;130.211.147.7 - - [23/Nov/2014:15:36:20 +0000] &amp;#34;GET / HTTP/1.0&amp;#34; 200 18701 &amp;#34;-&amp;#34; &amp;#34;NerdyBot&amp;#34;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;ln&#34;&gt;2&lt;/span&gt;&lt;span class=&#34;cl&#34;&gt;107.22.83.14 - - [23/Nov/2014:15:13:36 +0000] &amp;#34;GET /robots.txt HTTP/1.1&amp;#34; 200 345 &amp;#34;-&amp;#34; &amp;#34;HubSpot Crawler 1.0 http://www.hubspot.com/&amp;#34;&#xA;&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;ln&#34;&gt;3&lt;/span&gt;&lt;span class=&#34;cl&#34;&gt;192.99.107.190 - - [24/Nov/2014:14:49:46 +0000] &amp;#34;GET /robots.txt HTTP/1.1&amp;#34; 200 357 &amp;#34;-&amp;#34; &amp;#34;Mozilla/5.0 (compatible; meanpathbot/1.0; +http://www.meanpath.com/meanpathbot.html)&amp;#34;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;/div&gt;&#xA;&lt;p&gt;搜索了一下，得知：&lt;/p&gt;&#xA;&lt;ul&gt;&#xA;&lt;li&gt;NerdyBot是搜索引擎 (&lt;a href=&#34;http://nerdydata.com/&#34;  target=&#34;_blank&#34; rel=&#34;noreferrer&#34;&gt;http://nerdydata.com/&lt;/a&gt;) 的爬虫，这个主要是面向开发者搜索源代码（source code）的引擎。&lt;/li&gt;&#xA;&lt;li&gt;HubSpot Crawler是数字营销公司的爬虫，已经IPO了，连google都投资它了，传说hubspot的企业文化十分令人艳羡。&lt;/li&gt;&#xA;&lt;li&gt;meanpathbot 是付费搜索引擎 (&lt;a href=&#34;http://meanpath.com/&#34;  target=&#34;_blank&#34; rel=&#34;noreferrer&#34;&gt;http://meanpath.com/&lt;/a&gt;) 的爬虫，它的主要客户群是做语义分析/恶意软件及病毒分析/身份防窃保护之类的，免费试用可以点&lt;a href=&#34;https://meanpath.com/f/&#34;  target=&#34;_blank&#34; rel=&#34;noreferrer&#34;&gt;这里&lt;/a&gt;。&lt;/li&gt;&#xA;&lt;/ul&gt;&#xA;&lt;p&gt;突然觉得，有空写写爬虫也还蛮好玩的&amp;hellip;&lt;/p&gt;</description>
      
    </item>
    
  </channel>
</rss>
