Datensatz-Übersicht
Jeder Datensatz zeigt:
➤ Name
➤ Status
➤ Erstellungsdatum
➤ von welcher Person es erstellt wurde
Hinweis – Aktuelle Limits
➤ Max. 10 Datensätze pro Nutzer, je max. 10 GB.
➤ Datei-Grenzen: PDF 600 Seiten, PPTX 2.000 Folien, DOCX 16.000 Absätze, XLSX 300.000 Zeilen, Bilder 200 Megapixel.
Bei Überschreitung wird die betroffene Datei bzw. das Anlegen abgelehnt.
Schritt 1: Neuen Datensatz erstellen
Klicken Sie auf:
➤ „Datensatz erstellen“
Es öffnet sich das Dialogfenster „Neuen Datensatz erstellen“.
Datensatz-Name vergeben
Geben Sie einen eindeutigen, sprechenden Namen ein.
Der Name sollte den inhaltlichen Zweck des Datasets widerspiegeln (z. B. „Qualitätsmanagement 2024“ oder „Technische Dokumentation SMB“).
Öffentlich / Privat Toggle
Hier können Sie einstellen, ob das Dataset für alle Personen Ihrer Organisation zur Verfügung gestellt werden soll oder ob Sie dem Dataset granulare Berechtigungen hinzufügen möchten.
Berechtigungsregeln
Sollten Sie sich für granulare Berechtigungen entschieden haben, können Sie hier Benutzer hinzufügen, die Zugriff auf das Dataset erhalten sollen.
Über das Dropdown-Menü ‚Benutzer hinzufügen‘ werden Ihnen alle Nutzer angezeigt. Mit einem Klick auf den entsprechenden Namen werden sie Ihrem Dataset hinzugefügt. Nachdem ein Benutzer hinzugefügt wurde, erscheint sein Name unterhalb des Dropdown-Menüs. Sollten Sie Benutzer entfernen wollen, können Sie dies per Klick auf das X tun
Schritt 2: Quellen Hinzufügen
Unter „Data Sources“ legen Sie fest, welche Quellen dem Dataset hinzugefügt werden.
Mögliche Quellen
Je nach Systemkonfiguration stehen zur Verfügung:
➤ Integrierte Quellen
➤ Zuvor eingerichtete Konnektoren
Sie können beliebig viele Quellen hinzufügen. Nachdem Sie eine erste Quelle erstellt haben können die hierfür auf “+ Weitere Quelle hinzufügen” klicken.
Built-in Source: File Upload
Ermöglicht das direkte Hochladen von Dateien in das Dataset. Die unterstützen Dateiformate lauten:
-
.pdf -
.docx -
.pptx -
.xlsx -
.png -
.jpg -
.jpeg -
.gif
Built-in Source: Website
Ermöglicht das Crawlen einer Website-URL. Jede neue Website muss dabei über einen separaten Website-Konnektor angelegt werden.
Nachdem sie eine URL eingegeben haben können Sie Speichern klicken. Die Inhalte der angegebenen Seite werden entdeckt und dem Dataset hinzugefügt.
Entdeckung (Discover)
Bei der Entdeckung werden die angebundenen Quellen analysiert und verfügbare Inhalte identifiziert.
Dabei werden:
➤ Dateien oder Seiten erkannt
➤ Neue Inhalte registriert
Beim Erstellen des Datasets erfolgt die Entdeckung von Quellen automatisch. Den Fortschritt der Entdeckung einzelner Quellen können Sie dem Status entnehmen. zB.
Der Entdeckingsvorgang startet automatisch nachdem Sie eine Quelle hinzugefügt haben. Sie Können während des Entdeckungsvorgangs Silent AI anderweitig nutzen
Neu entdeckte Elemente
Beim ersten Entdeckungsvorgang einer Quelle sind alle gefundenen Elemente ausgewählt und werden bei der nächsten Extraktion eingelesen. Bei jedem weiteren Entdeckungsvorgang derselben Quelle werden neu gefundene Elemente nicht automatisch ausgewählt. Sie erscheinen in der Detailansicht ohne Haken.
➤ Setzen Sie den Haken bei den Elementen, die Sie einlesen möchten.
➤ Klicken Sie auf „Änderungen speichern“.
➤ Die ausgewählten Elemente werden bei der nächsten Extraktion verarbeitet.
Ihre bereits getroffene Auswahl bleibt dabei erhalten. Ein erneuter Entdeckungsvorgang setzt sie nicht zurück. So entscheiden Sie selbst, welche später hinzugekommenen Inhalte in Ihren Datensatz aufgenommen werden.
Datensatz speichern
Nach Konfiguration aller Einstellungen klicken Sie auf:
➤ „Fertig“
Das Dataset erscheint anschließend in der Datensatzverwaltung.
Hinweis:
Nach dem Speichern ist das Dataset zwar angelegt, jedoch noch nicht unmittelbar für Chat-Abfragen nutzbar.
Damit Inhalte im Chat verwendet werden können, müssen die entdeckten Datenquellen verarbeitet werden.
Extraktion
In der Datensatzverwaltung können Sie nun ihre entdeckten Quellen extrahieren. Bei der Extraktion werden die entdeckten Inhalte verarbeitet und für die Nutzung im Chat aufbereitet.
Dabei werden:
➤ Dokumente geladen
➤ Texte extrahiert
➤ Inhalte strukturiert
➤ Daten für Abfragen indexiert
➤ Änderungen an bestehenden Quellen erfasst und aktualisiert (inkl. Änderungen der Berechtigungen)
Erst nach erfolgreicher Extraktion stehen die Inhalte im Chat zur Verfügung.
Ausführungsmöglichkeiten
Für das gesamte Dataset:
➤ Über das Dataset-Menü (⋮):
„Jetzt ausführen“
Für einzelne Quellen:
➤ Über das Kontextmenü einer spezifischen Quelle in der Detailansicht des Datasets:
Extraktion nur für eine einzelne Quelle
Sie Können während des Entdeckungsvorgangs Silent AI anderweitig nutzen
Detailansicht
Die Detailsansicht für Datensätze bietet die Möglichkeit den Datensatz nachträglich zu bearbeiten. Der Name des Datensatzes den Sie Momentan ausgewählt haben ist dabei oben links angezeigt.
Sie können hier:
➤ Namen des Datensatzes anpassen
➤ Nachträglich Quellen Hinzufügen
➤ Granulare einsicht in den Extraktionsprozess einzelner Quellen erhalten
➤ Einzelne Quellen Erneut extrahieren (zB. fehlgeschlagene / neu hinzugefügte)
Erweiterung bestehender Datasets
Datasets sind nicht statisch und können jederzeit erweitert werden.
Mögliche Erweiterungen:
➤ Neue Datenquellen hinzufügen
➤ Weitere Dateien hochladen
➤ Zusätzliche Konnektoren anbinden
Nach dem Hinzufügen neuer Quellen müssen diese erneut:
➤ Entdeckt
➤ Extrahiert
werden, damit sie im Chat verfügbar sind.
Bereits vorhandene und extrahierte Inhalte bleiben dabei erhalten.
Typischer Aktualisierungs-Workflow
1.) Neue Quelle oder Datei hinzufügen wenn gewünscht: Klicken Sie hierfür den “+ Quelle Hinzufügen” Button. Das Hinzufügen erfolgt dabei identisch zum Hinzufügen von Datenquellen bei der ursprunglichen Erstellung des Datensets.
Je nach Systemkonfiguration stehen zur Verfügung:
➤ Zuvor eingerichtete Konnektoren (z. B. Confluence, NAS via SMB)
➤ Integrierte Quellen
-
File Upload – Dateien direkt hochladen
-
Website – Eine URL crawlen und Inhalte integrieren
Nachdem Sie eine neue Quelle hinzugefügt haben wird diese mit Status “Ausstehend” in den Datenquellen aufgeführt.
Das Abwählen einer Datenquelle (entfernen des Hakens) schließt diese lediglich von künftigen Extraktionsprozessen aus. Bereits extrahierte Inhalte bleiben im Chat verfügbar, bis die Quelle bzw. das Element explizit gelöscht (⋮) oder durch eine erneute Extraktion überschrieben wird.
Klicken Sie dann auf “Änderungen speichern”. Der Inhalt der neuen Datenquellen wird dann bei der nächsten Extraktion ihrem Datenset hinzugefügt.
Öffentlich vs. Privat
Datasets unterscheiden sich hinsichtlich ihrer Sichtbarkeit und Zugriffsberechtigung.
Private Datasets
Private Datasets, die Sie selbst erstellen:
➤ Sind ausschließlich für Sie sichtbar
➤ Können nur von Ihnen im Chat ausgewählt werden
➤ Sind für andere Nutzer nicht einsehbar
Zusätzliche Private Datasets mit definierten Berechtigungen
Sie können einen privaten Datensatz erstellen, der zusätzlich für bestimmte Personen sichtbar ist.
In diesem Fall:
➤ Ist das Dataset nur für die explizit hinterlegten Nutzer sichtbar
➤ Erscheint es in der Dataset-Liste nur bei diesen Personen
➤ Ist es für alle anderen Nutzer vollständig unsichtbar
Die berechtigten Nutzer sind im Dataset unter „Berechtigungsregeln“ explizit aufgeführt.
Nur dort angegebene Personen können das Dataset sehen und verwenden.
Dies gewährleistet eine kontrollierte, rollenbasierte Freigabe sensibler Inhalte.
Öffentliche Datasets
Öffentliche Datasets sind unternehmensweit sichtbar.
Sie:
➤ Können von allen berechtigten Nutzern eingesehen werden
➤ Stehen allen Nutzern zur Auswahl im Chat zur Verfügung
Daten aus Quellen mit Zugriffsbeschränkungen übernehmen diese auch in öffentlichen Datasets. Das Teilen eines Datasets umgeht nicht die Zugriffsbeschränkungen!