Facettensuche
Filter, die tatsächlich eingrenzen, weil hinter jedem einzelnen ein gepflegtes Feld steht.
Produktlisten, Kurskataloge, Stellenanzeigen, Anbieterverzeichnisse: Meist ist alles da, nur als Freitext, von jedem Lieferanten anders geschrieben und ohne genau die Merkmale, nach denen ein Kunde filtern würde. Die Pipeline normalisiert, klassifiziert, reichert an und verschlagwortet, satzweise und nachvollziehbar. Gerechnet wird auf einem lokalen Sprachmodell, auf Ihrem Server oder auf unserem, und kein Datensatz geht zu einem Cloudanbieter.
Business English, 20 Lekt./Woche à 45 Min, Kleingruppe max. 8 TN, ab B1, Malta, 2 Wochen ab 690,- inkl. Material
Der Preis pro Woche ist der interessante Wert. Aufgeschrieben hat ihn niemand, und ohne ihn kann kein Besucher zwei Angebote vergleichen.
Jede Ebene erledigt eine Aufgabe und lässt sich einzeln prüfen. Alles in einem Schritt zu erledigen ist der Grund, warum sich Ergebnisse später nicht mehr erklären lassen.
Einheiten, Schreibweisen, Währungen und Datumsformate kommen in eine Form.
Aus 690,- und EUR 690.00 wird dieselbe Zahl. Aus 20 Lekt. und 20 Unterrichtseinheiten wird dieselbe Angabe.
Jeder Datensatz bekommt seine Kategorie, Unterkategorie, Zielgruppe und Stufe.
Das Modell erfindet keine Kategorien, es wählt aus Ihrer Liste. Was nirgends passt, landet in der Prüfliste statt in der nächstbesten Schublade.
Was im Text steckt, aber in keinem Feld steht, wird herausgezogen und einzeln abgelegt.
Gruppengröße, Mindestalter, enthaltene Leistungen, Ausschlüsse. Genau die Merkmale, nach denen gefiltert wird und die fast niemand pflegt.
Facetten für die Filternavigation und Vektoren für die Ähnlichkeitssuche.
Danach findet jemand einen Kleingruppenkurs für Anfänger am Meer, ohne dass eines dieser Wörter im Datensatz steht.
Daten zu veredeln heißt, jeden Datensatz mehrfach durch ein Modell zu schicken und das Ganze zu wiederholen, sobald sich die Feldliste ändert. Genau diese Last wird in der Cloud teuer und unangenehm.
| Cloud-API | Lokales Modell | |
|---|---|---|
| Wohin die Daten gehen | Jeder Datensatz wird an einen Anbieter übertragen, oft außerhalb der EU | Die Daten bleiben auf der Maschine, auf der sie ohnehin liegen |
| Kosten bei Menge | Pro Datensatz, jedes Mal, auch beim zweiten Durchlauf | Rechenzeit, ohne Preis je Datensatz |
| Wiederholbarkeit | Ein Modellwechsel beim Anbieter kann Ergebnisse verändern | Modell und Version bleiben fest, bis Sie sie ändern |
| Nachvollziehbarkeit | Ein Wert kommt an, ohne dass sichtbar wäre, woraus er stammt | Jeder Wert trägt die Textstelle, aus der er gezogen wurde |
| Tempo bei großen Beständen | Begrenzt durch die Ratenlimits des Anbieters | So viele parallele Läufe, wie die Hardware trägt |
| Vertraulichkeit | Preise, Margen und Bezugsquellen verlassen das Haus | Nichts verlässt das Haus |
Dieselbe Hardware trägt Ihre übrigen KI-Anwendungen KI-Server
Veredeln ist nie das Ziel. Es ist der Schritt, der vorher passieren muss, damit das Folgende überhaupt funktioniert.
Filter, die tatsächlich eingrenzen, weil hinter jedem einzelnen ein gepflegtes Feld steht.
Aus Facetten werden eigenständige, indexierbare Seiten. 26 Orte und 8 Kategorien ergeben Seiten, die es vorher nicht gab.
Eine erzeugte Broschüre kann nur passende Angebote enthalten, wenn die Passung in den Daten steht. Brochure on Demand
Preis pro Woche, pro Einheit, pro Teilnehmer. Vergleichbar ist nur, was normalisiert ist.
Semantische Treffer statt Wortgleichheit, über lokal berechnete Vektoren.
Was fehlt, steht als nicht angegeben da und nie als Null. Dieser Unterschied entscheidet jede Auswertung, die darauf aufbaut.
Ein Sprachmodell, das eine Lücke füllen soll, füllt sie, notfalls mit etwas Plausiblem. Bei Produktdaten ist das der teuerste verfügbare Fehler, weil ein erfundener Preis nicht wie ein Fehler aussieht. Deshalb gilt in der Pipeline eine harte Regel: Jeder erzeugte Wert trägt die Textstelle, aus der er stammt. Findet sich keine, bleibt das Feld leer und der Datensatz wandert in eine Prüfliste.
Eine benannte Lücke schlägt eine geratene Zahl. Sie kostet einen Nachmittag Handarbeit und erspart den Anruf des Kunden, der zu einem Preis gebucht hat, den es nie gab.
Business English, 20 Lekt./Woche à 45 Min, Kleingruppe max. 8 TN, ab B1, Malta, 2 Wochen ab 690,- inkl. Material
Prüfliste für unsichere Werte
Die Pakete unterscheiden sich darin, wie viele Datensätze veredelt werden. Alles andere ist überall enthalten.
Passt fürEin Sortiment oder ein Verzeichnis.
Beispieldatei schickenPasst fürEin Portal mit laufenden Neuzugängen.
Beispieldatei schickenPasst fürMarktplätze und Aggregatoren mit Feeds vieler Lieferanten.
Beispieldatei schickenLäuft auf unserem Server oder auf einem eigenen KI-Server. Ab etwa fünfzigtausend Datensätzen ist eigene Hardware meist günstiger.
Ein offenes Modell auf eigener Hardware, ausgewählt nach Ihrem Fall, dazu ein eigenes Einbettungsmodell für die Ähnlichkeitssuche. Beide stehen in der Dokumentation, damit ein Lauf von heute in einem Jahr noch reproduzierbar ist.
Bei sauber formulierten Quelltexten ist die Trefferquote je Feld hoch. Bei Freitext, den 40 Lieferanten über 15 Jahre geschrieben haben, ist sie es nicht, und genau dafür gibt es die Prüfliste. Wir messen gegen eine Stichprobe, die Sie selbst von Hand ausfüllen, und nennen die Quote, bevor Sie sich entscheiden.
Die laufen automatisch durch dieselbe Strecke. Ein Neuimport braucht keinen zweiten Durchlauf über den Altbestand.
Ja, und die Korrektur gewinnt. Ein von Hand gesetzter Wert wird von keinem späteren Lauf überschrieben.
Für kleine Bestände nicht, da läuft es auf unserem. Ab einigen zehntausend Datensätzen lohnt sich eigene Hardware, und genau dort passt unser KI-Server dazu.
Deutsch und Englisch sind erprobt. Weitere Sprachen sind eine Frage des Modells und nicht der Pipeline.
Zehntausend Datensätze sind je nach Feldzahl über Nacht durch. Das Feldmodell vorher aufzusetzen dauert länger als der Lauf selbst.
Sie behalten die veredelten Daten, das Feldmodell und die Skripte. Alles liegt in Ihrer Datenbank und nicht in unserer.
Ein Ausschnitt aus Ihrem Bestand, egal wie unaufgeräumt. Sie bekommen dieselben fünfzig Zeilen veredelt zurück, dazu die Prüfliste und die ehrliche Zahl der Felder, die wir sicher besetzen konnten.
Ohne Verpflichtung, und die Datei verlässt unsere Maschine nicht.