Python字符串 *** 作，在html标签之间提取文本

电信测速ip • 2022-12-16 • 随笔 • 阅读 17

尽管可以使用正则表达式解析任意HTML，但这通常是一个死亡陷阱。有很多很棒的用于解析HTML的工具，包括BeautifulSoup，它是一个Python库，可以很好地处理
损坏的 HTML。

>>> from BeautifulSoup import BeautifulSoup as BSHTML>>> BS = BSHTML("""... <font face="ARIAL,HELVETICA" size="-2">  ... JUL 28         </font>"""... )>>> BS.font.contents[0].strip()u'JUL 28'

然后，您只需要解析日期：

>>> datetime.strptime(BS.font.contents[0].strip(), '%b %d')>>> datetime.datetime(1900, 7, 28, 0, 0)datetime.datetime(1900, 7, 28, 0, 0)

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/zaji/5645016.html

解析字符串很棒损坏提取

打赏

微信扫一扫

支付宝扫一扫

电信测速ip 一级用户组

0 0

Python导入DLL

上一篇 2022-12-16

Python艰难的方式-练习6-％r与％s

下一篇 2022-12-16

发表评论

登录后才能评论

Python字符串 *** 作，在html标签之间提取文本

发表评论

评论列表（0条）