Python字符串 *** 作,在html标签之间提取文本

Python字符串 *** 作,在html标签之间提取文本,第1张

Python字符串 *** 作,在html标签之间提取文本

尽管可以使用正则表达式解析任意HTML,但这通常是一个死亡陷阱。有很多很棒的用于解析HTML的工具,包括BeautifulSoup,它是一个Python库,可以很好地处理
损坏的 HTML。

>>> from BeautifulSoup import BeautifulSoup as BSHTML>>> BS = BSHTML("""... <font face="ARIAL,HELVETICA" size="-2">  ... JUL 28         </font>"""... )>>> BS.font.contents[0].strip()u'JUL 28'

然后,您只需要解析日期:

>>> datetime.strptime(BS.font.contents[0].strip(), '%b %d')>>> datetime.datetime(1900, 7, 28, 0, 0)datetime.datetime(1900, 7, 28, 0, 0)


欢迎分享,转载请注明来源:内存溢出

原文地址: http://outofmemory.cn/zaji/5645016.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2022-12-16
下一篇 2022-12-16

发表评论

登录后才能评论

评论列表(0条)

保存