POST https://api.acedata.cloud/webextrator/extract
Die WebExtrator Intelligente Extraktions-API wandelt eine URL in typisierte strukturierte Ergebnisse um – Artikel, Produkte, Rezepte, Videos, Diskussionen, Stellenangebote usw., und liefert gleichzeitig bereinigtes Markdown und reinen Text. Wenn Sie “saubere strukturierte Daten” anstelle von rohem HTML wünschen, ist dies die Schnittstelle, die Sie verwenden sollten.
Im Hintergrund gibt es eine dreistufige Pipeline:
- schema.org JSON-LD Mapper – deterministisch, null LLM-Kosten. Deckt Wikipedia / BestBuy / AllRecipes / YouTube / die meisten Nachrichten / die meisten Produktseiten ab.
- Typisierte LLM-Extraktion – wird nur ausgelöst, wenn schema.org nicht zutrifft. Schema wird je nach Seitentyp ausgewählt, Zod strenge Validierung.
- Readability + Markdown Absicherung – läuft immer, um die obersten Felder der ersten beiden Ebenen zu ergänzen.
Antragsprozess
Um den WebExtrator-Dienst zu nutzen, gehen Sie zuerst zur Ace Data Cloud Konsole, um Ihr API-Token zu erhalten, das Sie für später aufbewahren.
Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, die Sie zur Registrierung und Anmeldung einlädt. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet.
Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, ohne dass für jeden Dienst separat beantragt werden muss. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent, um es kostenlos auszuprobieren; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr allgemeines Guthaben aufladen.
📘 Vollständige Dokumentation: WebExtrator-Dienstseite →
Authentifizierung
Anfrageparameter
Extract akzeptiert alle Render API Parameter (url, user_agent, timeout, wait_until, delay, wait_for_selector,
block_resources, headers, cookies, callback_url, bypass_cache,
cache_ttl_seconds, async), plus zwei Extract-spezifische Felder:
Wenn die Seite schema.org JSON-LD enthält, ist enable_llm unwirksam – der deterministische Mapper gibt direkt Ergebnisse zurück,
es wird niemals eine LLM-Anfrage verschwendet. Sie erhalten kostenlos typisierte Ergebnisse.
Synchronisierte Antwort
Oberste Felder
data.structured Unterfelder
schema.org Mapper Abdeckung
Nach Priorität sortiert (bei Treffer alsstructured.schemaOrg.primary):
Mapper Verarbeitung:
@graphContainer (rekursiv entfaltet);@typeArray (z. B.["Recipe", "NewsArticle"]— beide werden erkannt, der mit höherer Priorität gewinnt);- Varianten mit dem Präfix
http://schema.org/; - Verschachtelte
OfferundAggregateOffer(letzteres liestlowPrice); - Relative Bild-URLs (werden gemäß
finalUrlin absolute umgewandelt).
LLM typisierte Schema
Wennenable_llm: true und schema.org keinen primären Eintrag hat, extrahiert der Scraper heuristisch nach URL
(oder expected_type Hinweis) und wählt eines der folgenden Zod Schema Validierungsmodelle aus:
Bei Erfolg wird LLM auch die “last-resort” Rückfüllung in die obersten Felder vornehmen:
article→description/byline/publishedAt/languageproduct→descriptiondiscussion→description(= body die ersten 280 Zeichen) /byline(= author) /publishedAt(= postedAt)recipe→description/byline(= author)video→description/byline(= channel) /publishedAt(= uploadDate)job→description/byline(= company) /publishedAt(= datePosted)
Cache
Gleiche Anfragen werden auf denselben Redis Key gehasht:webextrator:cache:extract:<sha256(canonical-json)>. Der Cache Key ignoriert async,
bypass_cache, cache_ttl_seconds (dies ist ein Schalter, der die Antwort nicht beeinflusst). cookies /
headers werden in Buckets zwischengespeichert.
Antworten, die den Cache treffen, enthalten
data.cached: true und data.cacheStoredAt: <unix-ms>.
Asynchroner Modus und Rückruf
Setzen Sieasync: true, um in den asynchronen Modus zu wechseln (das Bereitstellen von callback_url führt ebenfalls automatisch dazu). Die Plattform gibt sofort zurück (HTTP 200):
callback_url (sofern konfiguriert) POST gesendet. Sie können auch später aktiv über /webextrator/tasks abfragen.
Beispiel
1. Wikipedia Artikel (schema.org Treffer, kein LLM erforderlich)
data.structured.schemaOrg.primary Schlüssel-Felder:
2. BestBuy Produktseite (schema.org Treffer)
3. AllRecipes Rezeptseite (mit Nährwert und Schritten)
4. HN Diskussionsseite (ohne JSON-LD —— LLM aktivieren)
data.structured.llm.data:
byline = "alice"、publishedAt = "..."。
5. Amazon Produktseite (Amazon ohne JSON-LD —— LLM aktivieren)
data.structured.llm.data (typisiert product):
Python (requests)
Node.js (fetch)
Hinweise und Fallstricke
- Wenn
expected_typeübergeben werden kann, dann übergeben. Kostenlose Hinweise, um heuristische Bewertungen zu überspringen, besonders nützlich für Seiten, deren URL-Muster nicht in der eingebauten Liste enthalten ist. enable_llm: trueist auf Seiten mit schema.org Treffer kostenlos. LLM wird nur aufgerufen, wenn schema.org kein primäres Element hat, daher ist es standardmäßig auch sicher.- Überprüfen Sie zuerst
rawSignals.hasJsonLdbeim Debuggen. Wenn estrueist, aberstructured.schemaOrg.primarynullist, bedeutet das, dass die Seite einen@typeverwendet hat, den unser Mapper noch nicht abgedeckt hat – bitte ein Issue erstellen, wir fügen es hinzu. structured.llmErrorist informativ. Die Anfrage war weiterhin erfolgreich, heuristische Ergebnisse werden weiterhin zurückgegeben. Überprüfen SiellmError.error, um den Grund zu lokalisieren (Zeitüberschreitung, JSON-Parsing-Fehler, Zod-Validierungsfehler).- Links[] auf Nicht-Artikel-Seiten werden nicht nach Relevanz sortiert. Nur nach “maximal 100 Einträgen + Filterung ungültiger Protokolle” wird versucht, zu reinigen.
- Cache-Treffer werden ebenfalls berechnet. Der Cache dient der Verzögerung und dem Schutz des Browser-Pools, nicht um Geld zu sparen.

