Версия для печати темы
Нажмите сюда для просмотра этой темы в оригинальном формате
Форум программистов > Python: Общие вопросы > Парсинг html с помощью lxml


Автор: Karadul 14.5.2012, 05:52
Почему lxml.html.parse() возвращает ElementTree, а lxml.html.document_fromstring() - Element html?

Можно сделать tree.getroot() - и он будет html, но зачем такая разница? И почему cssselect работает только для Element, но не для ElementTree?

[offtop]
Код

Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "d:\Program Files\Python27\lib\site-packages\lxml-2.3-py2.7-win32.egg\lxml\html\__init__.py", line 692, in parse
    return etree.parse(filename_or_url, parser, base_url=base_url, **kw)
  File "lxml.etree.pyx", line 2942, in lxml.etree.parse (src/lxml/lxml.etree.c:54187)
  File "parser.pxi", line 1553, in lxml.etree._parseDocument (src/lxml/lxml.etree.c:79727)
TypeError: cannot parse from 'builtin_function_or_method'

80k строк в файле?

Powered by Invision Power Board (http://www.invisionboard.com)
© Invision Power Services (http://www.invisionpower.com)