Python实现在线程里运行scrapy的方法

2019-11-25 17:49:17

字体：大中小

来源：转载

供稿：网友

本文实例讲述了Python实现在线程里运行scrapy的方法。分享给大家供大家参考。具体如下：

如果你希望在一个写好的程序里调用scrapy，就可以通过下面的代码，让scrapy运行在一个线程里。

"""Code to run Scrapy crawler in a thread - works on Scrapy 0.8"""import threading, Queuefrom twisted.internet import reactorfrom scrapy.xlib.pydispatch import dispatcherfrom scrapy.core.manager import scrapymanagerfrom scrapy.core.engine import scrapyenginefrom scrapy.core import signalsclass CrawlerThread(threading.Thread):  def __init__(self):    threading.Thread.__init__(self)    self.running = False  def run(self):    self.running = True    scrapymanager.configure(control_reactor=False)    scrapymanager.start()    reactor.run(installSignalHandlers=False)  def crawl(self, *args):    if not self.running:      raise RuntimeError("CrawlerThread not running")    self._call_and_block_until_signal(signals.spider_closed, /      scrapymanager.crawl, *args)  def stop(self):    reactor.callFromThread(scrapyengine.stop)  def _call_and_block_until_signal(self, signal, f, *a, **kw):    q = Queue.Queue()    def unblock():      q.put(None)    dispatcher.connect(unblock, signal=signal)    reactor.callFromThread(f, *a, **kw)    q.get()# Usage example below: import osos.environ.setdefault('SCRAPY_SETTINGS_MODULE', 'myproject.settings')from scrapy.xlib.pydispatch import dispatcherfrom scrapy.core import signalsfrom scrapy.conf import settingsfrom scrapy.crawler import CrawlerThreadsettings.overrides['LOG_ENABLED'] = False # avoid log noisedef item_passed(item):  print "Just scraped item:", itemdispatcher.connect(item_passed, signal=signals.item_passed)crawler = CrawlerThread()print "Starting crawler thread..."crawler.start()print "Crawling somedomain.com...."crawler.crawl('somedomain.com) # blocking callprint "Crawling anotherdomain.com..."crawler.crawl('anotherdomain.com') # blocking callprint "Stopping crawler thread..."crawler.stop()

希望本文所述对大家的Python程序设计有所帮助。

上一篇：编写简单的Python程序来判断文本的语种

下一篇：Python实现从脚本里运行scrapy的方法