Skip to main content
POST https://api.acedata.cloud/webextrator/render WebExtrator webbrendering API är en webbrenderingstjänst baserad på headless Chromium. Ge en URL, returnera den helt renderade HTML (inklusive JS-injicerat innehåll), ren text, sidtitel och slutlig URL. Render är WebExtrators mest grundläggande gränssnitt. Om du behöver strukturerade extraktionsresultat (artikeltext, produktpriser, receptingredienser …), vänligen använd /webextrator/extract — det kör en hel uppsättning typad extraktionspipeline på samma renderingsgrund.

Ansökningsprocess

För att använda WebExtrator-tjänsten, börja med att gå till Ace Data Cloud-konsolen för att få din API-token, som du kan spara för framtida bruk. Om du inte har loggat in eller registrerat dig, kommer du automatiskt att omdirigeras till inloggningssidan för att registrera dig och logga in, och efter att ha slutfört detta kommer du automatiskt att återvända till den aktuella sidan. En API-token kan användas för att anropa alla tjänster på plattformen, utan att behöva ansöka om varje tjänst separat. Första ansökan ger en gratis kvot, så att du kan prova gratis; när kvoten är slut kan du ladda på allmänna saldot i konsolen.
📘 Fullständig dokumentation: WebExtrator tjänstsida →

Autentisering

Alla WebExtrator-gränssnitt använder standard Bearer Token-autentisering:

Begärningsparametrar

Plattformens avtal använder enhetligt snake_case. Interna renderingtjänster stöder camelCase, men externa anrop använder alltid snake_case.

Synkron respons

Asynkron respons

async=true (eller ange callback_url) returnerar omedelbart (HTTP 200):
Resultatet kommer att skickas via POST till callback_url (om konfigurerat), eller genom /webextrator/tasks kan du aktivt fråga.

Återkopplingsstruktur

Plattformen POST:ar en envelope som är helt identisk med den synkrona modellen till callback_url, Content-Type: application/json. Att returnera valfritt 2xx betraktas som bekräftat; 5xx kommer att återföras med exponentiell backoff i cirka 5 minuter.

Felrespons

Felstruktur:

Exempel

cURL

Python (requests)

Node.js (fetch)

Asynkron + Callback

Omedelbart returnera { "success": true, "task_id": "...", "trace_id": "...", "started_at": 1777717800.123 }; När uppgiften är klar kommer plattformen att POST:a hela resultatet till din callback_url.

Tvinga att kringgå cache

Tips och fallgropar

  • Att välja rätt wait_until är viktigt. networkidle är mest stabil men långsam; domcontentloaded är snabb men kan missa asynkront injicerat innehåll; load passar traditionella statiska sidor.
  • Cache-nyckel ignorerar async. Samma URL:s synkrona och asynkrona begärningar träffar samma cachepost, att växla fritt kommer inte att misslyckas.
  • Cache-nyckel ignorerar bypass_cache och cache_ttl_seconds. Dessa två är operationsbrytare, påverkar inte svarsinnehållet.
  • cookies och headers kommer att dela upp cache. Anpassning av dessa två kommer att göra att första samma kombination misslyckas.
  • Tunga SPA:er överskrider ofta standard 30 sekunder. Rekommenderar timeout: 60, wait_until: "domcontentloaded", delay: 4, och kombinera med wait_for_selector för att vänta på de element som verkligen är viktiga.
  • block_resources är den snabbaste vägen att minska latens. Standard har redan blockerat bilder / typsnitt / media; Om du extraherar utan att vara beroende av CSS-layout, kan du lägga till stylesheet för att bli ännu snabbare.