Empfang Telefon, Chat, Termine, Rückruf
Dokumentation Angebote, Protokolle, Rechnungen
Alle KI-Lösungen →
Windows & Systeme Updates, Probleme, Linux
Office & Kommunikation E-Mail, Teams, Podcast
Alle Software-Leistungen →
Computer & Laptops PC, Mac, Kaufberatung
Mobilgeräte Smartphone, TV, Fotos
Alle Hardware-Leistungen →
IT-Infrastruktur VPN, Netzwerk, DSGVO
Business-Software Buchhaltung, Kasse, Zeiterfassung
Alle Unternehmens-Leistungen →
spuerwerk© Mess-Module Temperatur, CO², Strom, .
spuerwerk© Branchen I Apotheke, Praxis, Hotel, .
Alle Submarken →
Web-Scraping als Dienstleistung

Daten aus Webseiten, zuverlässig abgerufen

Viele Portale geben ihre Inhalte nur an echte Browser heraus. Ein einfacher Abruf mit file_get_contents bleibt dann leer, wird umgeleitet oder abgewiesen.

Wir bauen Ihnen das Abrufskript, das den fertigen HTML-Quelltext zuverlässig liefert. Auf Wunsch lesen wir auch gleich die Datenfelder aus und legen sie als Tabelle ab. Sie bekommen den Quelltext und entscheiden selbst, wie weit Sie übernehmen.

HTML oder FelderQuelltext pur oder fertig ausgelesen
Headless-Browserwenn JavaScript nachlädt
Pausen eingebautRücksicht auf die Quelle
Quelltext dabeiLizenz + Service
https://portal.beispiel/inserate?seite=1 <article class="inserat"> <h2>Titel des Inserats</h2> <span class="preis">Preis</span> <span class="ort">Ort</span> <time datetime="…">Datum</time> </article> HTTP 200 · vollständig TITEL PREIS ORT DATUM

Oben der fertige Quelltext, wie ihn ein Browser sieht. Unten dieselben Angaben als Tabelle, wenn Sie das Auslesen mitbestellen. Schematische Darstellung ohne echte Daten.

Der Ausgangspunkt

Warum der einfache Abruf so oft leer bleibt

Ein Browser schickt mit jedem Seitenaufruf eine ganze Reihe von Angaben mit: wer er ist, welche Sprache er versteht, welche Cookies er vom letzten Besuch hat. Ein nackter Abruf aus einem Skript schickt fast nichts davon. Viele Portale behandeln ihn deshalb anders als einen Menschen am Bildschirm.

Dazu kommt, dass moderne Seiten ihren Inhalt häufig erst im Browser zusammensetzen. Der Quelltext, den der Server ausliefert, ist dann nur ein Gerüst. Die Inserate, Preise oder Termine werden per JavaScript nachgeladen und tauchen im einfachen Abruf nie auf.

Die Lösung ist selten kompliziert, aber sie muss zur Seite passen. Deshalb sehen wir uns die Quelle zuerst an und bauen dann genau so viel, wie sie verlangt.

Fehlende Browser-KennungDie Anfrage verrät sich als Skript und wird abgewiesen.
403
Cookies und WeiterleitungDie Seite setzt erst ein Cookie und leitet dann um. Ohne Cookie-Verwaltung endet der Abruf im Kreis.
302
Inhalt per JavaScriptDer Server liefert nur das Gerüst, die Daten kommen erst im Browser dazu.
<div></div>
Zu dichte FolgeZu viele Abrufe in kurzer Zeit führen zur Drosselung oder Sperre.
429
Leistung

Was wir für Sie bauen

Abrufskript für den Quelltext

Eine Funktion oder ein Kommandozeilenaufruf: URL hinein, fertiger HTML-Quelltext heraus. Mit vollständigen Kopfzeilen, Cookie-Verwaltung und Wiederholung bei kurzen Aussetzern.

Headless-Browser für nachgeladene Seiten

Wenn der Inhalt erst per JavaScript entsteht, baut ein Browser ohne Oberfläche die Seite vollständig auf. Zurück kommt der Quelltext so, wie Sie ihn am Bildschirm sehen würden.

Felder auslesen, auf Wunsch

Titel, Preis, Ort, Datum oder was Ihre Quelle hergibt, sauber getrennt als CSV, JSON oder direkt in Ihre Datenbank. Mit Prüfung, ob die Felder zur Anzeige passen.

Zeitplan und Meldung

Der Abruf läuft zu festen Zeiten von selbst und meldet sich, wenn die Quelle etwas Unerwartetes liefert. Für dauerhafte Reihen mit Auswertung gibt es unsere Marktbeobachtung.

Einsatz

Wofür Betriebe Web-Scraping einsetzen

Inserate und Kleinanzeigen beobachten

Neue Angebote in einer Kategorie, einer Region oder zu einem Suchbegriff, sobald sie erscheinen. Für den Einkauf gebrauchter Maschinen, für Immobilien- und Flächensuche oder für den Blick auf den eigenen Markt.

Preise und Verfügbarkeit bei Lieferanten

Listenpreise, Lagerbestände und Lieferzeiten aus Händlerseiten ohne eigene Schnittstelle. Damit Angebote nicht auf Zahlen vom letzten Quartal beruhen.

Ausschreibungen und Veröffentlichungen

Vergabeportale, Amtsblätter und Verbandsseiten, die keine Benachrichtigung anbieten. Das Skript sammelt neue Einträge und Sie sehen morgens, was dazugekommen ist.

Daten aus Altsystemen übernehmen

Eine alte Website, ein Kundenportal oder eine Anwendung ohne Exportfunktion. Wir lesen den Bestand aus der Oberfläche aus, damit er in ein neues System übernommen werden kann.

Lieferumfang

Was Sie bekommen und wo es läuft

Das Paket

Ein lauffähiges Skript in der Sprache, die zu Ihrer Umgebung passt, meist PHP, Python oder Node.js. Dazu der vollständige Quelltext, eine kurze Anleitung, ein Beispielaufruf und eine dauerhafte Lizenz für den Einsatz im eigenen Betrieb.

Die Auswertung der Daten bleibt bei Ihnen, wenn Sie das möchten. Oder wir übernehmen sie mit, bis zur fertigen Tabelle.

Die Umgebung

Der einfache Abruf läuft auf fast jedem Webspace, auf dem eigenen Server oder lokal. Ein Headless-Browser braucht einen Server oder Rechner, auf dem Programme dauerhaft laufen dürfen.

Welche Variante Ihre Quelle verlangt und ob Ihr Paket sie trägt, klären wir vor dem Bau. Das Ergebnis steht im Angebot, nicht in einer Überraschung nach der Übergabe.

Grenzen

Woran sich jedes Skript von uns hält

Nur öffentlich Abrufbares und eigene Zugänge

Wir lesen, was ohne Anmeldung sichtbar ist, oder was Sie mit Ihrem eigenen Konto sehen dürfen. Fremde Zugangsdaten, Bezahlschranken und Zugriffssperren umgehen wir nicht.

Rücksicht auf die Quelle

Feste Pausen, begrenzte Parallelität und ein Abbruch bei Drosselung. Der Abruf soll dauerhaft funktionieren und die Seite nicht belasten, auch nicht in der Summe.

Personenbezogene Daten sparsam

Inserate enthalten oft Namen und Kontaktdaten. Das Skript erfasst nur die Felder, die Sie für Ihren Zweck wirklich brauchen. Was nicht gebraucht wird, landet gar nicht erst in Ihrem Bestand.

Technik ja, Rechtsberatung nein

Wir klären die technische Machbarkeit. Ob Nutzungsbedingungen, Datenbankrecht oder Datenschutz Ihrem Vorhaben entgegenstehen, bewertet Ihre Rechtsberatung. Wir liefern dafür auf Wunsch eine schriftliche Beschreibung, was genau abgerufen wird.

Ablauf

Vom Link zum fertigen Skript

Beispielseite senden

Ein Link genügt, dazu Ihre Umgebung und die grobe Menge an Abrufen pro Tag. Mehr brauchen wir für den Anfang nicht.

Quelle prüfen

Wir testen den Abruf, sehen nach, woran der einfache Weg scheitert, und nennen Ihnen danach einen Festpreis schriftlich.

Skript bauen

Wir bauen den Abruf, prüfen das Ergebnis gegen die sichtbare Seite und sichern ihn gegen stille Fehler ab.

Übergabe

Quelltext, Anleitung und Beispielaufruf gehen an Sie. Ändert die Quelle später ihren Aufbau, passen wir das Skript per Fernwartung an.



Beschreiben Sie Ihr Anliegen

Schreiben Sie uns kurz, worum es geht. Wir prüfen die Anfrage und melden uns per E-Mail mit dem nächsten Schritt.

Häufig gestellte Fragen

Warum bekomme ich mit file_get_contents keine Daten?

Weil viele Portale erkennen, dass kein Browser anfragt. Es fehlen die übliche Kennung, Cookies aus einem vorherigen Seitenaufruf oder die Sprach- und Formatangaben, die jeder Browser mitschickt. Häufig kommt dann eine leere Seite, eine Weiterleitung oder ein Fehlercode zurück. Liegt der Inhalt erst nach dem Ausführen von JavaScript vor, steht er im ursprünglichen Quelltext gar nicht drin. Welcher Fall vorliegt, sehen wir an Ihrer Beispielseite.

Reicht ein einfacher Abruf, oder braucht es einen Browser?

Das entscheidet die Seite, nicht der Geschmack. Kommt der Inhalt bereits mit dem ersten Abruf, genügt eine saubere Anfrage mit vollständigen Kopfzeilen und Cookie-Verwaltung. Das ist schnell, schlank und läuft fast überall. Wird der Inhalt nachgeladen, setzen wir einen Headless-Browser ein, der die Seite vollständig aufbaut und dann den fertigen Quelltext zurückgibt.

Läuft das Skript auf unserem Shared Hosting?

Der einfache Abruf in den meisten Fällen ja, sofern ausgehende Verbindungen erlaubt sind. Einige Tarife schalten Funktionen ab, die dafür üblich sind. Das prüfen wir vorab auf Ihrem Paket. Ein Headless-Browser braucht dagegen einen eigenen Server oder einen Rechner, auf dem Programme dauerhaft laufen dürfen. Das sagen wir vor dem Bau, nicht danach.

Was passiert, wenn die Website ihren Aufbau ändert?

Das ist der Normalfall, nicht die Ausnahme. Deshalb prüft das Skript seine Ergebnisse auf Plausibilität und meldet sich, statt stillschweigend leere oder halbe Daten zu liefern. Die Anpassung an einen geänderten Aufbau übernehmen wir als Service oder Sie ändern die Stelle selbst, weil Sie den Quelltext haben.

Ist Web-Scraping erlaubt?

Die rechtliche Bewertung Ihres Vorhabens nehmen wir nicht vor, das ist Aufgabe Ihrer Rechtsberatung. Technisch trennen wir sauber, was dafür wichtig ist: öffentlich abrufbar oder hinter einer Anmeldung, einzelne Angaben oder wesentliche Teile einer Datenbank, mit oder ohne personenbezogene Daten. Dazu kommen die Nutzungsbedingungen der Quelle. Diese Punkte sollten vor dem Start geklärt sein.

Wie oft darf das Skript abfragen?

So selten wie möglich und so oft wie nötig. Wir bauen feste Pausen zwischen den Abrufen ein, begrenzen parallele Anfragen und werten Rückmeldungen zur Drosselung aus. Das schont die Quelle und hält Ihren Abruf dauerhaft stabil. Eine Seite, die im Minutentakt abgefragt wird, sperrt früher oder später.

Bekommen wir den Quelltext?

Ja. Sie erhalten das Skript mit Quelltext, einer kurzen Anleitung und einem Beispielaufruf, dazu eine dauerhafte Lizenz für den Einsatz im eigenen Betrieb. Anpassungen und Betreuung laufen auf Wunsch als Service.

Was kostet ein solches Skript?

Das hängt an der Quelle. Ein einfacher Abruf ist ein anderer Aufwand als ein Browser mit Anmeldung am eigenen Konto und Seitenwechsel. Deshalb prüfen wir zuerst Ihre Beispielseite und nennen danach einen Festpreis schriftlich.

Cookie-EinwilligungTechnisch notwendige Cookies sind immer aktiv. Externe Inhalte wie Terminbuchung und Kartenmaterial sowie Google Analytics laden wir erst nach Ihrer Zustimmung. Mehr erfahren