При парсинге выдает ошибку 503. В чем может проблема?
from bs4 import BeautifulSoup import requests url = requests.get('https://www.eldorado.ru/?utm_source=yandex&utm_medium=organic&utm_campaign=yandex&utm_referrer=yandex') headers = { "Accept": "*/*", "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36" } req = requests.get(url, headers=headers) src = req.text print(src) |
from bs4 import BeautifulSoup import requests url = requests.get('https://www.eldorado.ru/?utm_source=yandex&utm_medium=organic&utm_campaign=yandex&utm_referrer=yandex') headers = { "Accept": "*/*", "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36" } req = requests.get(url, headers=headers) src = req.text print(src)
Буду рад, если распишите более подробно, как обходить данную ошибку.
Дополнительно:
При парсинге выдает ошибку 503. В чем может проблема?
В данном исполнение - никак. requests возвращает html, который сервер вернул при первом запросе, а сервер первым возвращает 503 ответ, затем js loader (загрузку), а уже затем необходимую страницу.
КартинкО
Буду рад, если распишите более подробно, как обходить данную ошибку.
В данном случае - использовать selenium + undetected_chromedriver/selenium-stealth.
Я сильно сомневаюсь, что этот сайт без антибот защиты
MagicMight прав, а DmitriyKLN еще придется с этой защитой столкнуться.
- Хорошо, понял, спасибо.
Ответы:
Потому что (как минимум) неправильный набор хедеров. Это можно проверить даже скопировав оригинал запроса в curl и выполнив его там, получить валидный ответ. А потом порезать хедеры до того, что вы предложили.
И он кинет в ответ 503 ошибку. Чтобы удостовериться, используйте опцию curl --head.
Я сильно сомневаюсь, что этот сайт без антибот защиты, чтобы его можно было долго так бомбить в лоб
там сайт на next.js если нужно спарсить то нужно через selenium заходить
Опишите проблему, и специалист поможет с настройкой, исправлением ошибки или доработкой сайта. Подберём понятный план работ без лишней переписки.
Пока нет других ответов. Будьте первым, кто поможет автору.
Ответить на вопрос

Ошибка 503 означает, что сервер не смог обработать запрос из-за временной недоступности или перегрузки. Есть несколько возможных причин, по которым может возникать данная проблема:
1. **Перегрузка сервера**: Если сервер перегружен большим количеством запросов, он может временно не справляться с обработкой всех запросов и выдавать ошибку 503. В таком случае, попробуйте обновить страницу позже или обратитесь к администратору сервера.
2. **Проблемы с интернет-соединением**: Неустойчивое или медленное интернет-соединение также может вызывать ошибку 503 при попытке парсинга страницы. Проверьте свое соединение и попробуйте повторить запрос.
3. **Неправильные настройки парсера**: Возможно, у вас неправильно настроен парсер, из-за чего он не может обработать страницу корректно. Убедитесь, что все параметры парсера правильно сконфигурированы и соответствуют требованиям сайта.
4. **Блокировка сервера для парсинга**: Возможно, сервер, который вы пытаетесь парсить, блокирует запросы от автоматических скриптов или ботов. Проверьте правила доступа к серверу и убедитесь, что ваш запрос не нарушает их.
5. **Проблемы с самим сайтом**: Иногда ошибка 503 может быть вызвана проблемами на стороне самого сайта, который вы пытаетесь парсить. В таком случае, лучше подождать некоторое время и попробовать снова.
Если после проверки всех вышеперечисленных причин проблема все еще не решена, рекомендуется обратиться к администратору сервера или технической поддержке сайта для получения дополнительной помощи.