Взываю отложить пивко\водочку\коньячок на пару мин в сторону и помочь решить проблему

Парсю таким кодом
def prepare_content(url): headers = {'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.95 Safari/537.36'} response = requests.get(url, headers=headers) tree = fromstring(response.text) tree.make_links_absolute(response.url) return tree
Нужно обработать “date”:
date = tree.xpath('.//div[@class="h3"]/text()')[1].strip().split(',')[0] print(date) # 'Ночь c 27 ноября на 28 ноября' if 'Ночь с' in date: date = ' '.join(a.split()[-2:])
Не срабатывает “if ‘Ночь с’ in date”.
Делаю проверку:
1) Копирую ‘Ночь c 27 ноября на 28 ноября’ и оставляю из нее только ‘Ночь c’
2) Руками на клаве набираю ‘Ночь с’
Делаю п1 == п2 аля ‘Ночь c’ == ‘Ночь c’ и получаю False!
Делаю проверку №2, беру оба раза ‘Ночь c’ с фразы ‘Ночь c 27 ноября на 28 ноября’, сравниваю и получаю True.
С этого же сайта получаю другую строку:
movie = tree.xpath('.//h2/a/text()')[0] print(movie) # 'Стажер (2015)'
Из “результата отработки парсера” скопировал строку ‘Стажер (2015)’ и сделал х = ‘Стажер (2015)’, в итоге получил ‘Стажер\xa0(2015)’
(C “датой”, что выше, такой финт не получился)
“\xa0” - у меня и на других сайтах вылазит
Я знаю, что это “пробел”.Гуглил и поиском прошелся на форуме - можно чистить строки через replace или через join (strip не помогает) - но как по мне, не вариант - парсится много всего, скорость упадет. Я в кодировках плаваю… Может есть какой то вариант, чтоб засунуть в функцию prepare_content какой-то код, чтоб “чистило” всю запарсеную страницу?
Хотелось бы получать текст точно такой же, как прямо в IDE набираю, без всяких “примисей”.
Благодарю.
Вот и я в итоге в лыжи обутый)