À propos des insights sur les données non structurées

Une analyse de profilage des données non structurées dans Knowledge Catalog transforme les données sombres ou les fichiers non structurés tels que les PDF dans Cloud Storage en éléments structurés et interrogeables dans BigQuery. Alors que les outils de découverte standards sont limités aux métadonnées au niveau des fichiers, telles que la taille et le type, une analyse de profilage des données non structurées basée sur les modèles Vertex AI Gemini analyse le contenu des fichiers. Elle extrait automatiquement le contexte métier requis pour ancrer les agents d'IA et alimenter l'analyse avancée.

Cette automatisation élimine le besoin d'analyse manuelle des documents et de code ETL personnalisé, ce qui vous permet de découvrir, de classer et d'utiliser des données auparavant inaccessibles.

Une analyse de profilage des données non structurées analyse le contenu des fichiers non structurés pour extraire des informations et déduire des schémas. Cela diffère de la fonctionnalité d'insights sur les données structurées, qui génère des descriptions et des requêtes SQL basées sur les métadonnées des tables structurées existantes, et du profilage statistique standard des données, qui calcule des métriques telles que le nombre de valeurs nulles et les distributions de valeurs.

Découverte automatisée et profilage sémantique

Vous pouvez effectuer le profilage des données non structurées à l'aide de deux workflows différents, en fonction de votre point de départ :

  • Lors d'une analyse de découverte Cloud Storage : une analyse de découverte localise automatiquement vos fichiers non structurés dans Cloud Storage et les catalogue dans une ou plusieurs tables d'objets dans BigQuery pour analyse. Une table d'objets est une table en lecture seule sur des objets de données non structurés stockés dans Cloud Storage. Lorsque vous exécutez une analyse de découverte avec l'option Activer l'inférence sémantique activée, elle sert de point d'entrée automatisé pour le profilage des données non structurées.

  • En tant qu'analyse de profilage des données non structurées autonome : si vous disposez déjà de tables d'objets BigQuery existantes, vous pouvez exécuter une analyse de profilage des données non structurées directement sur ces tables. Dans ce workflow autonome, vous pouvez également guider l'extraction en fournissant un prompt personnalisé dans la spécification DataScan.

Lorsque le profilage des données non structurées est effectué (automatiquement lors d'une analyse de découverte ou en tant qu'analyse autonome), le système enregistre les tables d'objets en tant qu'entrées dans Knowledge Catalog. Une entrée représente un élément de données pour lequel vous capturez des métadonnées. Lorsque plusieurs tables sont créées en raison d'une analyse de découverte, chaque entrée possède son propre onglet "Insights". Vous pouvez ensuite ouvrir cette entrée pour explorer les insights sur les données générés. Le système effectue les actions suivantes :

  1. Identifie et regroupe les fichiers (analyse de découverte uniquement). Identifie et organise automatiquement les fichiers non structurés dans Cloud Storage en tables d'objets. Ces tables d'objets sont des tables en lecture seule qui fournissent une interface structurée à vos données non structurées.