chore: попытка сделать так же как у scrapling

This commit is contained in:
protokey committed 2026-09-23 14:40:50 +04:00
1 parent 8a464391a2
commit 8f8bc62ae7
5 files changed
+142 -14

No files matched your search

+2 -1
View File
@@ -84,7 +84,8 @@ class CloudflareDetector(Detector):
async def detect(self, page: Page, info: ChallengeInfo):
log.debug("CloudflareDetector run")
await wait_for_page_stability(page, False, True)
await wait_for_networkidle(page)
log.debug("Страница загружена полностью")
info.meta = {}
widget_selector = "div.cf-turnstile[data-sitekey], div[data-sitekey].cf-turnstile"
+8
View File
@@ -37,6 +37,14 @@ def load_or_create_fingerprint(user_data_dir: Path, **generator_kwargs) -> Finge
return _fingerprint_from_dict(json.loads(fp_file.read_text()))
generator_kwargs.setdefault("browser", ["chrome"])
# strict=True: без него browserforge при отсутствии точного совпадения в датасете
# тихо ослабляет даже нижнюю границу screen (min_width/min_height) — на практике
# так может прилететь мобильный экран под десктопный viewport (screen.availWidth
# меньше самого окна браузера — физически невозможно и легко детектится), а в
# части случаев цикл релаксации виснет на неопределённое время вместо быстрого
# ответа. Со strict=True generate() либо отдаёт честно подходящий сэмпл, либо
# сразу кидает ValueError — и то и другое быстро (~0.1с)
generator_kwargs.setdefault("strict", True)
fingerprint = FingerprintGenerator().generate(**generator_kwargs)
fp_file.write_text(fingerprint.dumps())
return fingerprint
+69
View File
@@ -0,0 +1,69 @@
"""
Мелкие хелперы навигации, портированные из scrapling.engines.toolbelt.navigation
и scrapling.engines.toolbelt.proxy_rotation — адаптированы под patchright/async.
В отличие от полного Session/PagePool из scrapling.engines._browsers._base, тут
браузер запускается и закрывается на каждый запрос (см. main.py), поэтому
переиспользовать нечего — берём только то, что относится к одной навигации:
блокировку ресурсов/доменов на странице и детект прокси-ошибок для retry.
"""
from typing import Callable, Optional
from urllib.parse import urlparse
from patchright.async_api import Route
# ресурсы, которые можно дропать ради скорости — портировано из
# scrapling.engines.constants.EXTRA_RESOURCES
EXTRA_RESOURCES = {
"font", "image", "media", "beacon", "object",
"imageset", "texttrack", "websocket", "csp_report", "stylesheet",
}
# признаки прокси-ошибки в тексте исключения — портировано из
# scrapling.engines.toolbelt.proxy_rotation._PROXY_ERROR_INDICATORS
_PROXY_ERROR_INDICATORS = (
"net::err_proxy", "net::err_tunnel", "connection refused",
"connection reset", "connection timed out", "failed to connect",
"could not resolve proxy",
)
def is_proxy_error(error: Exception) -> bool:
"""Похоже ли исключение на сбой прокси (а не на обычную ошибку навигации)."""
msg = str(error).lower()
return any(indicator in msg for indicator in _PROXY_ERROR_INDICATORS)
def _is_domain_blocked(hostname: str, domains: frozenset) -> bool:
"""Матчинг хоста и его родительских доменов за O(1) на каждый уровень —
портировано из scrapling.engines.toolbelt.navigation._is_domain_blocked."""
if hostname in domains:
return True
idx = hostname.find(".")
while idx != -1:
suffix = hostname[idx + 1:]
if "." in suffix and suffix in domains:
return True
idx = hostname.find(".", idx + 1)
return False
def create_intercept_handler(disable_resources: bool, blocked_domains: Optional[set] = None) -> Callable:
"""Обработчик route, блокирующий типы ресурсов и/или домены — портировано из
scrapling.engines.toolbelt.navigation.create_async_intercept_handler."""
disabled_resources = EXTRA_RESOURCES if disable_resources else set()
domains = frozenset(blocked_domains) if blocked_domains else frozenset()
async def handler(route: Route) -> None:
if route.request.resource_type in disabled_resources:
await route.abort()
elif domains:
hostname = urlparse(route.request.url).hostname or ""
if _is_domain_blocked(hostname, domains):
await route.abort()
else:
await route.continue_()
else:
await route.continue_()
return handler
+9
View File
@@ -35,3 +35,12 @@ class SolveRequest(BaseModel):
captcha_detect_locator: str | None = None
captcha_success_locator: str | None = None
captcha_type: str | None = None
# ниже — опции навигации, портированные из scrapling.engines._browsers (StealthySession.fetch),
# все выключены/нейтральны по умолчанию, чтобы поведение для текущих вызывающих не менялось
disable_resources: bool = False
blocked_domains: list[str] | None = None
retries: int = 1
retry_delay: float = 1.0
wait: int = 0
google_search: bool = False
+54 -13
View File
@@ -1,3 +1,4 @@
import asyncio
import json
import logging
import traceback
@@ -14,10 +15,12 @@ from fastapi import Response
from patchright.async_api import ProxySettings
from patchright.async_api import async_playwright
from antibot.humanize import wait_for_page_stability
from engine import actions
from engine.browser_launch import HARMFUL_ARGS, launch_args, stealth_context_options
from engine.fingerprint import apply_fingerprint, context_options_for, load_or_create_fingerprint
from engine.geoip import resolve_geo
from engine.navigation import create_intercept_handler, is_proxy_error
from engine.schemas import SolveRequest
logger = logging.getLogger(__name__)
@@ -62,9 +65,9 @@ async def solve(
"ok": False,
"error": "No slots available",
}
else:
BROWSER_SLOTS -= 1
try:
if not session_id:
session_id = str(uuid.uuid4())
response.set_cookie("session_id", session_id)
@@ -74,32 +77,41 @@ async def solve(
scr_size = int(scr_w), int(scr_h)
proxy = parse_proxy(payload.proxy)
# профиль (cookies/local storage/fingerprint.json) хранится на диске по
# session_id — если он уже приходил в куках, ниже подгружаем существующий
# fingerprint из этой папки; если нет (новый session_id) — генерируем новый
# и сохраняем туда же (см. engine/fingerprint.py:load_or_create_fingerprint)
user_data_dir = Path(__file__).parent / f"../extra/user_data_dir/{session_id}"
if not user_data_dir.exists():
user_data_dir.mkdir(parents=True)
# geo — до создания fingerprint'а, чтобы производная от прокси locale (см. engine/geoip.py)
# попала в сам fingerprint, а не подменяла его задним числом
# geo — до создания fingerprint'а, чтобы производная от прокси locale
# (см. engine/geoip.py) попала в сам fingerprint, а не подменяла его
# задним числом
geo = await resolve_geo(proxy)
locale = geo.get("locale") if geo else None
fp_kwargs = {}
if payload.user_agent:
fp_kwargs["user_agent"] = payload.user_agent
# TODO: если есть session_id, то user_agent нужно взять из настроек пользователя
if locale:
fp_kwargs["locale"] = locale
fingerprint = load_or_create_fingerprint(
user_data_dir,
# только нижняя граница: реалистичный монитор должен быть не меньше запрошенного окна,
# а точный верхний потолок слишком часто не находится в датасете и тихо "ослабляется"
# browserforge (актуальный размер окна мы всё равно берём из payload.screen ниже, не отсюда)
# только нижняя граница: реальный монитор физически не может быть
# меньше открытого на нём окна браузера (viewport ниже берём из
# payload.screen напрямую, не отсюда). load_or_create_fingerprint
# генерирует с strict=True, так что это ограничение либо честно
# соблюдается, либо сразу падает ValueError — датасет browserforge
# больше не может тихо подсунуть сюда, например, мобильный экран
screen=Screen(min_width=scr_size[0], min_height=scr_size[1]),
**fp_kwargs,
)
ctx_kwargs = {
# базовые анти-детект опции ниже — fingerprint накладывается поверх и выигрывает
# при конфликте по user_agent/viewport/device_scale_factor
# базовые анти-детект опции ниже — fingerprint накладывается поверх
# и выигрывает при конфликте по user_agent/viewport/device_scale_factor
**stealth_context_options(),
**context_options_for(
fingerprint,
@@ -116,11 +128,17 @@ async def solve(
permissions.append("geolocation")
ctx_kwargs["permissions"] = permissions
nav_timeout_ms = payload.timeout * 1000 if payload.timeout else 60_000
default_timeout_ms = payload.timeout * 1000 if payload.timeout else 30_000
blocked_domains = set(payload.blocked_domains) if payload.blocked_domains else None
referer = "https://www.google.com/" if payload.google_search else None
retries = max(1, payload.retries)
async with async_playwright() as p:
context = await p.chromium.launch_persistent_context(
user_data_dir=str(user_data_dir),
proxy=proxy,
headless=False,
headless=True,
channel="chrome",
args=launch_args(locale=locale),
ignore_default_args=HARMFUL_ARGS,
@@ -131,10 +149,19 @@ async def solve(
page = context.pages[0] if context.pages else await context.new_page()
if payload.cookies:
await context.add_cookies(payload.cookies)
page.set_default_timeout(30_000)
page.set_default_navigation_timeout(60_000)
page.set_default_timeout(default_timeout_ms)
page.set_default_navigation_timeout(nav_timeout_ms)
if payload.disable_resources or blocked_domains:
await page.route("**/*", create_intercept_handler(payload.disable_resources, blocked_domains))
await page.goto(url=payload.url)
status = error = user_agent = None
cookies = html = None
actions_result = None
for attempt in range(retries):
try:
await page.goto(url=payload.url, referer=referer)
await wait_for_page_stability(page, load_dom=True, network_idle=False)
actions_result = await actions.execute(
page, payload.actions, payload.captcha,
@@ -142,6 +169,8 @@ async def solve(
success_locator=payload.captcha_success_locator,
detect_locator=payload.captcha_detect_locator,
)
if payload.wait:
await page.wait_for_timeout(payload.wait)
status = not "error" in actions_result[-1]
error = ["Something error", None][status]
@@ -155,10 +184,22 @@ async def solve(
# f"{datetime.timestamp(datetime.now())}.png"
# )
# )
break
except Exception as e:
if attempt < retries - 1:
kind = "прокси" if is_proxy_error(e) else "запрос"
logger.warning(
"Попытка %s/%s не удалась (%s: %s), retry через %.1fs",
attempt + 1, retries, kind, e, payload.retry_delay,
)
await asyncio.sleep(payload.retry_delay)
else:
raise
finally:
await context.close()
finally:
BROWSER_SLOTS += 1
result = {
"status": ["err", "ok"][status],
"user_agent": user_agent,