尽管可以使用正则表达式解析任意HTML,但这通常是一个死亡陷阱。有很多很棒的用于解析HTML的工具,包括BeautifulSoup,它是一个Python库,可以很好地处理
损坏的 HTML。
>>> from BeautifulSoup import BeautifulSoup as BSHTML>>> BS = BSHTML("""... <font face="ARIAL,HELVETICA" size="-2"> ... JUL 28 </font>"""... )>>> BS.font.contents[0].strip()u'JUL 28'
然后,您只需要解析日期:
>>> datetime.strptime(BS.font.contents[0].strip(), '%b %d')>>> datetime.datetime(1900, 7, 28, 0, 0)datetime.datetime(1900, 7, 28, 0, 0)
欢迎分享,转载请注明来源:内存溢出
评论列表(0条)