Produkt · Datenveredelung

Rohdaten hinein, durchsuchbare Datensätze heraus.

Produktlisten, Kurskataloge, Stellenanzeigen, Anbieterverzeichnisse: Meist ist alles da, nur als Freitext, von jedem Lieferanten anders geschrieben und ohne genau die Merkmale, nach denen ein Kunde filtern würde. Die Pipeline normalisiert, klassifiziert, reichert an und verschlagwortet, satzweise und nachvollziehbar. Gerechnet wird auf einem lokalen Sprachmodell, auf Ihrem Server oder auf unserem, und kein Datensatz geht zu einem Cloudanbieter.

  • Lokales Modell, keine Cloud
  • Server in Deutschland
  • Jeder Wert mit Herkunft
  • Wiederholbare Läufe
Ein Datensatz, vorher und nachher
Wie er ankommt

Business English, 20 Lekt./Woche à 45 Min, Kleingruppe max. 8 TN, ab B1, Malta, 2 Wochen ab 690,- inkl. Material

Wie er danach aussieht
Kategorie
Sprachkurs, berufsbezogen
Ort
Malta
Intensität
20 Lektionen pro Woche, je 45 Minuten
Gruppengröße
maximal 8
Mindestniveau
B1
Preis
690 € für 2 Wochen, 345 € pro Woche
Enthalten
Kursmaterial
Facetten
Berufsbezogen · Kleingruppe · Fortgeschritten

Der Preis pro Woche ist der interessante Wert. Aufgeschrieben hat ihn niemand, und ohne ihn kann kein Besucher zwei Angebote vergleichen.

Vier Ebenen, in dieser Reihenfolge

Jede Ebene erledigt eine Aufgabe und lässt sich einzeln prüfen. Alles in einem Schritt zu erledigen ist der Grund, warum sich Ergebnisse später nicht mehr erklären lassen.

  1. 1

    Normalisieren

    Einheiten, Schreibweisen, Währungen und Datumsformate kommen in eine Form.

    Aus 690,- und EUR 690.00 wird dieselbe Zahl. Aus 20 Lekt. und 20 Unterrichtseinheiten wird dieselbe Angabe.

  2. 2

    Klassifizieren

    Jeder Datensatz bekommt seine Kategorie, Unterkategorie, Zielgruppe und Stufe.

    Das Modell erfindet keine Kategorien, es wählt aus Ihrer Liste. Was nirgends passt, landet in der Prüfliste statt in der nächstbesten Schublade.

  3. 3

    Anreichern

    Was im Text steckt, aber in keinem Feld steht, wird herausgezogen und einzeln abgelegt.

    Gruppengröße, Mindestalter, enthaltene Leistungen, Ausschlüsse. Genau die Merkmale, nach denen gefiltert wird und die fast niemand pflegt.

  4. 4

    Verschlagworten

    Facetten für die Filternavigation und Vektoren für die Ähnlichkeitssuche.

    Danach findet jemand einen Kleingruppenkurs für Anfänger am Meer, ohne dass eines dieser Wörter im Datensatz steht.

Warum das auf einem eigenen Modell läuft

Daten zu veredeln heißt, jeden Datensatz mehrfach durch ein Modell zu schicken und das Ganze zu wiederholen, sobald sich die Feldliste ändert. Genau diese Last wird in der Cloud teuer und unangenehm.

Cloud-APILokales Modell
Wohin die Daten gehenJeder Datensatz wird an einen Anbieter übertragen, oft außerhalb der EUDie Daten bleiben auf der Maschine, auf der sie ohnehin liegen
Kosten bei MengePro Datensatz, jedes Mal, auch beim zweiten DurchlaufRechenzeit, ohne Preis je Datensatz
WiederholbarkeitEin Modellwechsel beim Anbieter kann Ergebnisse verändernModell und Version bleiben fest, bis Sie sie ändern
NachvollziehbarkeitEin Wert kommt an, ohne dass sichtbar wäre, woraus er stammtJeder Wert trägt die Textstelle, aus der er gezogen wurde
Tempo bei großen BeständenBegrenzt durch die Ratenlimits des AnbietersSo viele parallele Läufe, wie die Hardware trägt
VertraulichkeitPreise, Margen und Bezugsquellen verlassen das HausNichts verlässt das Haus

Dieselbe Hardware trägt Ihre übrigen KI-Anwendungen KI-Server

Was möglich wird, sobald die Daten sauber sind

Veredeln ist nie das Ziel. Es ist der Schritt, der vorher passieren muss, damit das Folgende überhaupt funktioniert.

Facettensuche

Filter, die tatsächlich eingrenzen, weil hinter jedem einzelnen ein gepflegtes Feld steht.

Landingpages je Kombination

Aus Facetten werden eigenständige, indexierbare Seiten. 26 Orte und 8 Kategorien ergeben Seiten, die es vorher nicht gab.

Broschüren und Kataloge

Eine erzeugte Broschüre kann nur passende Angebote enthalten, wenn die Passung in den Daten steht. Brochure on Demand

Vergleich und Rangfolgen

Preis pro Woche, pro Einheit, pro Teilnehmer. Vergleichbar ist nur, was normalisiert ist.

Ähnlichkeitssuche

Semantische Treffer statt Wortgleichheit, über lokal berechnete Vektoren.

Sichtbare Lücken

Was fehlt, steht als nicht angegeben da und nie als Null. Dieser Unterschied entscheidet jede Auswertung, die darauf aufbaut.

Was das Modell nicht darf

Ein Sprachmodell, das eine Lücke füllen soll, füllt sie, notfalls mit etwas Plausiblem. Bei Produktdaten ist das der teuerste verfügbare Fehler, weil ein erfundener Preis nicht wie ein Fehler aussieht. Deshalb gilt in der Pipeline eine harte Regel: Jeder erzeugte Wert trägt die Textstelle, aus der er stammt. Findet sich keine, bleibt das Feld leer und der Datensatz wandert in eine Prüfliste.

Eine benannte Lücke schlägt eine geratene Zahl. Sie kostet einen Nachmittag Handarbeit und erspart den Anruf des Kunden, der zu einem Preis gebucht hat, den es nie gab.

Preis
690 € für 2 Wochen, 345 € pro Woche

Business English, 20 Lekt./Woche à 45 Min, Kleingruppe max. 8 TN, ab B1, Malta, 2 Wochen ab 690,- inkl. Material

Sichtbare Lücken

Prüfliste für unsichere Werte

Ein Preis, drei Größen

Die Pakete unterscheiden sich darin, wie viele Datensätze veredelt werden. Alles andere ist überall enthalten.

Einrichtung
ab 2.900 € einmalig
Betrieb
ab 190 € im Monat

Mittel

Am häufigsten gewählt
Datensätzebis 50.000

Passt fürEin Portal mit laufenden Neuzugängen.

Beispieldatei schicken

Groß

Datensätzeunbegrenzt

Passt fürMarktplätze und Aggregatoren mit Feeds vieler Lieferanten.

Beispieldatei schicken

In jedem Paket enthalten

  • Feld- und Facettenmodell aus Ihrem eigenen Bestand
  • Prüfliste für unsichere Werte
  • Erstlauf über den gesamten Bestand
  • Neuzugänge laufen automatisch mit
  • Export in Ihre Datenbank, Ihre Suche oder Ihre Website
  • Hosting, Updates und Support

Läuft auf unserem Server oder auf einem eigenen KI-Server. Ab etwa fünfzigtausend Datensätzen ist eigene Hardware meist günstiger.

Fragen, bevor die erste Datei kommt

Welches Modell rechnet da?+

Ein offenes Modell auf eigener Hardware, ausgewählt nach Ihrem Fall, dazu ein eigenes Einbettungsmodell für die Ähnlichkeitssuche. Beide stehen in der Dokumentation, damit ein Lauf von heute in einem Jahr noch reproduzierbar ist.

Wie genau ist das?+

Bei sauber formulierten Quelltexten ist die Trefferquote je Feld hoch. Bei Freitext, den 40 Lieferanten über 15 Jahre geschrieben haben, ist sie es nicht, und genau dafür gibt es die Prüfliste. Wir messen gegen eine Stichprobe, die Sie selbst von Hand ausfüllen, und nennen die Quote, bevor Sie sich entscheiden.

Was passiert mit neuen Datensätzen?+

Die laufen automatisch durch dieselbe Strecke. Ein Neuimport braucht keinen zweiten Durchlauf über den Altbestand.

Können wir die Ergebnisse korrigieren?+

Ja, und die Korrektur gewinnt. Ein von Hand gesetzter Wert wird von keinem späteren Lauf überschrieben.

Brauchen wir einen eigenen Server?+

Für kleine Bestände nicht, da läuft es auf unserem. Ab einigen zehntausend Datensätzen lohnt sich eigene Hardware, und genau dort passt unser KI-Server dazu.

Welche Sprachen?+

Deutsch und Englisch sind erprobt. Weitere Sprachen sind eine Frage des Modells und nicht der Pipeline.

Wie lange dauert der erste Lauf?+

Zehntausend Datensätze sind je nach Feldzahl über Nacht durch. Das Feldmodell vorher aufzusetzen dauert länger als der Lauf selbst.

Was passiert, wenn wir aufhören?+

Sie behalten die veredelten Daten, das Feldmodell und die Skripte. Alles liegt in Ihrer Datenbank und nicht in unserer.

Schicken Sie uns fünfzig Zeilen.

Ein Ausschnitt aus Ihrem Bestand, egal wie unaufgeräumt. Sie bekommen dieselben fünfzig Zeilen veredelt zurück, dazu die Prüfliste und die ehrliche Zahl der Felder, die wir sicher besetzen konnten.

Beispieldatei schicken

Ohne Verpflichtung, und die Datei verlässt unsere Maschine nicht.