POST https://api.acedata.cloud/webextrator/extract
WebExtrator intelligent extrahering API omvandlar en URL till typad strukturerad resultat — artiklar, produkter, recept, videor, diskussioner, rekrytering etc., samtidigt som den bifogar rengjord Markdown och ren text. När du vill ha “ren strukturerad data” istället för rå HTML, är detta gränssnittet att använda.
Underliggande är en tre-lagers pipeline:
- schema.org JSON-LD mappare — deterministisk, noll LLM kostnad. Täcker Wikipedia / BestBuy / AllRecipes / YouTube / de flesta nyheter / de flesta produktsidor.
- Typad LLM extrahering — utlöses endast när schema.org inte träffar. Välj schema baserat på sidtyp, Zod strikt validering.
- Readability + Markdown fallback — körs alltid, fyller i toppfält som de två första lagren inte har fyllt.
Ansökningsprocess
För att använda WebExtrator-tjänsten, gå först till Ace Data Cloud-konsolen för att hämta din API-token, som du kan spara för framtida bruk.
Om du inte har loggat in eller registrerat dig, kommer du automatiskt att omdirigeras till inloggningssidan som bjuder in dig att registrera dig och logga in, och efter att ha slutfört detta kommer du automatiskt att återvända till den aktuella sidan.
En API-token räcker för att anropa alla tjänster på plattformen, du behöver inte ansöka separat för varje tjänst. Första ansökan ger en gratis kvot, så att du kan prova gratis; när kvoten är slut kan du ladda på allmän balans i konsolen.
📘 Fullständig dokumentation: WebExtrator tjänstsida →
Auktorisering
Förfrågningsparametrar
Extract accepterar alla Render API parametrar (url, user_agent, timeout, wait_until, delay, wait_for_selector,
block_resources, headers, cookies, callback_url, bypass_cache,
cache_ttl_seconds, async), plus två Extract-specifika fält:
När sidan har schema.org JSON-LD, är enable_llm ogiltig — den deterministiska mapparen ger direkt resultat,
kommer aldrig att slösa LLM-anrop. Du får gratis typade resultat.
Synkron respons
Toppfält
data.structured underfält
schema.org-mappningens täckning
Sorterat efter prioritet (träffar somstructured.schemaOrg.primary):
Mappningens hantering:
@graphbehållare (rekursivt utvidgad);@typearray (som["Recipe", "NewsArticle"]—— båda identifieras, den med högst prioritet vinner);http://schema.org/prefixvarianter;- Nästlade
OfferochAggregateOffer(den senare läserlowPrice); - Relativa bild-URL:er (löses till absoluta enligt
finalUrl).
LLM typiserad Schema
Närenable_llm: true och schema.org inte har någon primary, extraktorn använder URL heuristik
(eller expected_type hint) för att välja en av Zod Schema valideringsmodellens utdata:
LLM kommer också att göra “last-resort” återfyllning till toppfältet när:
article→description/byline/publishedAt/languageproduct→descriptiondiscussion→description(= body de första 280 tecknen) /byline(= author) /publishedAt(= postedAt)recipe→description/byline(= author)video→description/byline(= channel) /publishedAt(= uploadDate)job→description/byline(= company) /publishedAt(= datePosted)
Cache
Samma begäran kommer att hashas till samma Redis-nyckel:webextrator:cache:extract:<sha256(canonical-json)>. Cache-nyckeln ignorerar async,
bypass_cache, cache_ttl_seconds (detta är en operationell switch, påverkar inte svaret). cookies /
headers kommer att delas upp i cache.
Svar som träffar cachen kommer att ha
data.cached: true och data.cacheStoredAt: <unix-ms>.
Asynkront läge och callback
Ställ inasync: true för att gå in i asynkront läge (att tillhandahålla callback_url kommer också automatiskt att gå in). Plattformen returnerar omedelbart (HTTP 200):
POST till din callback_url (om det är konfigurerat). Du kan också
aktivt fråga senare via /webextrator/tasks.
Exempel
1. Wikipedia-artikel (schema.org träff, ingen LLM behövs)
data.structured.schemaOrg.primary nyckelfält:
2. BestBuy produkt sida (schema.org träff)
3. AllRecipes receptsida (inklusive näringsinnehåll och steg)
4. HN diskussionssida (utan JSON-LD —— behöver aktivera LLM)
data.structured.llm.data:
byline = "alice"、publishedAt = "..."。
5. Amazon produkt sida (Amazon utan JSON-LD —— behöver aktivera LLM)
data.structured.llm.data (typad produkt):
Python (requests)
Node.js (fetch)
Tips och fallgropar
- Kan skicka
expected_typeså gör det. Gratis tips, hoppa över heuristisk bedömning, särskilt användbart för sidor vars URL-mönster inte finns i den inbyggda listan. enable_llm: truepå sidor med schema.org träff är gratis. LLM anropas endast när schema.org inte har primary, så det är säkert att ha det aktiverat som standard.- Vid felsökning, kolla först
rawSignals.hasJsonLd. Om det ärtruemenstructured.schemaOrg.primaryärnull, betyder det att sidan använde en typ som vår mappare ännu inte täcker — rapportera ett problem så lägger vi till det. structured.llmErrorär informativ. Begäran lyckas fortfarande, heuristiska resultat returneras fortfarande. KollallmError.errorför att lokalisera orsaken (timeout, JSON-parsing misslyckades, Zod-validering misslyckades).- Icke-artikelsidor sorterar inte
links[]efter relevans. Endast enligt “max 100 poster + filtrera bort ogiltiga protokoll” görs en ansträngning för att rensa. - Cacheträffar debiteras också. Cachen är för fördröjning och skydd av webbläsarpoolen, inte för att spara pengar.

