Найти - Пользователи
Полная версия: Парсинг страниц
Начало » Python для новичков » Парсинг страниц
1
cubespace
В нете нашел вот такой пример парсинга страниц:

 import json
from urllib.parse import urljoin
import requests
from parsel import Selector
index = requests.get('http://books.toscrape.com/')
books = []
for href in Selector(index.text).css('.product_pod a::attr(href)').extract():
    url = urljoin(index.url, href)
    book_page = requests.get(url)
    sel = Selector(book_page.text)
    books.append({
        'title': sel.css('h1::text').extract_first(),
        'price': sel.css('.product_main .price_color::text')extract_first(),
        'image': sel.css('#product_gallery img::attr(src)').extract_first()
    })
with open('books.json', 'w') as fp:
    json.dump(books, fp)

Сейчас скрипт проходит только по краткой новости всех книг и берет информацию с главной.
Как его изменить чтобы заходило в страницу (новость) и брало от туда информацию о книге и так так пройтись по каждой книге ?
DamMercul
Надо больше информации. Какой сайт, какие там теги используют под книги, <pre> не <pre>. И для этой задачи лучше используй bs4 с lxml/html.parser, это будет быстрее, удобнее. А так ничем помочь не могу пока все не выложишь
sosok43k
Если нужна будет помощь, пишите на почту)
DamMercul
sosok43k
Если нужна будет помощь, пишите на почту)
Лол, это тебе помощь нужна, с фига ли я буду париться и писать тебе на почту чтобы ТЕБЕ помочь? Просто выложи весь или большую часть кода сюда и разберемся

UPD: УУПС, извини, я думал это автор топика написал)
sosok43k
DamMercul
УУПС, извини, я думал это автор топика написал)
Ничего страшного)
This is a "lo-fi" version of our main content. To view the full version with more information, formatting and images, please click here.
Powered by DjangoBB