La API Vision puede detectar y extraer información sobre entidades de una imagen en un amplio grupo de categorías.
Las etiquetas pueden identificar objetos generales, ubicaciones, actividades, especies de animales, productos y más. Si necesitas etiquetas personalizadas de segmentación, Cloud AutoML Vision te permite entrenar un modelo de aprendizaje automático personalizado para clasificar imágenes.
Las etiquetas solo se devuelven en inglés. La API Cloud Translation puede traducir etiquetas en inglés a cualquiera de los otros idiomas.
Por ejemplo, la imagen de arriba puede devolver la siguiente lista de etiquetas:
| Descripción | Puntuación |
|---|---|
| Calle | 0,872 |
| Captura | 0,852 |
| Localidad | 0,848 |
| Noche | 0,804 |
| Callejón | 0,713 |
Solicitudes de detección de etiquetas
Configurar el Google Cloud proyecto y la autenticación
Si no has creado un Google Cloud proyecto, hazlo ahora. Despliega esta sección para ver las instrucciones.
- Sign in to your Google Cloud account. If you're new to Google Cloud, create an account to evaluate how our products perform in real-world scenarios. New customers also get $300 in free credits to run, test, and deploy workloads.
-
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
-
Enable the Vision API.
Roles required to enable APIs
To enable APIs, you need the Service Usage Admin IAM role (
roles/serviceusage.serviceUsageAdmin), which contains theserviceusage.services.enablepermission. Learn how to grant roles. -
Install the Google Cloud CLI.
-
Si utilizas un proveedor de identidades (IdP) externo, primero debes iniciar sesión en la CLI de gcloud con tu identidad federada.
-
Para inicializar gcloud CLI, ejecuta el siguiente comando:
gcloud init -
In the Google Cloud console, on the project selector page, select or create a Google Cloud project.
Roles required to select or create a project
- Select a project: Selecting a project doesn't require a specific IAM role—you can select any project that you've been granted a role on.
-
Create a project: To create a project, you need the Project Creator role
(
roles/resourcemanager.projectCreator), which contains theresourcemanager.projects.createpermission. Learn how to grant roles.
-
Verify that billing is enabled for your Google Cloud project.
-
Enable the Vision API.
Roles required to enable APIs
To enable APIs, you need the Service Usage Admin IAM role (
roles/serviceusage.serviceUsageAdmin), which contains theserviceusage.services.enablepermission. Learn how to grant roles. -
Install the Google Cloud CLI.
-
Si utilizas un proveedor de identidades (IdP) externo, primero debes iniciar sesión en la CLI de gcloud con tu identidad federada.
-
Para inicializar gcloud CLI, ejecuta el siguiente comando:
gcloud init - BASE64_ENCODED_IMAGE: representación en base64 (cadena ASCII) de los datos de imagen binarios. Esta cadena debe ser similar a la siguiente:
/9j/4QAYRXhpZgAA...9tAVx/zDQDlGxn//2Q==
- RESULTS_INT: (Opcional) Valor entero de los resultados que se van a devolver. Si omites el campo
"maxResults"y su valor, la API devuelve el valor predeterminado de 10 resultados. Este campo no se aplica a los siguientes tipos de funciones:TEXT_DETECTION,DOCUMENT_TEXT_DETECTIONoCROP_HINTS. - PROJECT_ID: tu ID de proyecto Google Cloud .
mid: si está presente, contiene un identificador generado por la máquina (MID) que corresponde a la entrada de la entidad en el gráfico de conocimiento de Google. Tenga en cuenta que los valores demidsiguen siendo únicos en los distintos idiomas, por lo que puede usarlos para vincular entidades de diferentes idiomas. Para inspeccionar los valores de MID, consulta la documentación de la API Google Knowledge Graph.description: la descripción de la etiqueta.score: la puntuación de confianza, que va de 0 (sin confianza) a 1 (confianza muy alta).topicality: relevancia de la etiqueta ICA (anotación de contenido de imagen) en la imagen. Mide la importancia o centralidad de una etiqueta en el contexto general de una página.
Detectar etiquetas en una imagen local
Puedes usar la API Vision para detectar rasgos en un archivo de imagen local.
En el caso de las solicitudes REST, envíe el contenido del archivo de imagen como una cadena codificada en Base64 en el cuerpo de la solicitud.
En el caso de las solicitudes de gcloud y de bibliotecas de cliente, especifica la ruta a una imagen local en tu solicitud.
REST
Antes de usar los datos de la solicitud, haz las siguientes sustituciones:
Método HTTP y URL:
POST https://vision.googleapis.com/v1/images:annotate
Cuerpo JSON de la solicitud:
{
"requests": [
{
"image": {
"content": "BASE64_ENCODED_IMAGE"
},
"features": [
{
"maxResults": RESULTS_INT,
"type": "LABEL_DETECTION"
}
]
}
]
}
Para enviar tu solicitud, elige una de estas opciones:
curl
Guarda el cuerpo de la solicitud en un archivo llamado request.json
y ejecuta el siguiente comando:
curl -X POST \
-H "Authorization: Bearer $(gcloud auth print-access-token)" \
-H "x-goog-user-project: PROJECT_ID" \
-H "Content-Type: application/json; charset=utf-8" \
-d @request.json \
"https://vision.googleapis.com/v1/images:annotate"
PowerShell
Guarda el cuerpo de la solicitud en un archivo llamado request.json
y ejecuta el siguiente comando:
$cred = gcloud auth print-access-token
$headers = @{ "Authorization" = "Bearer $cred"; "x-goog-user-project" = "PROJECT_ID" }
Invoke-WebRequest `
-Method POST `
-Headers $headers `
-ContentType: "application/json; charset=utf-8" `
-InFile request.json `
-Uri "https://vision.googleapis.com/v1/images:annotate" | Select-Object -Expand Content
Si la solicitud se realiza de forma correcta, el servidor devuelve un código de estado HTTP 200 OK y la respuesta en formato JSON.
Una respuesta LABEL_DETECTION incluye las etiquetas detectadas, su puntuación, su actualidad y un ID de etiqueta opaco.
{
"responses": [
{
"labelAnnotations": [
{
"mid": "/m/01c8br",
"description": "Street",
"score": 0.87294734,
"topicality": 0.87294734
},
{
"mid": "/m/06pg22",
"description": "Snapshot",
"score": 0.8523099,
"topicality": 0.8523099
},
{
"mid": "/m/0dx1j",
"description": "Town",
"score": 0.8481104,
"topicality": 0.8481104
},
{
"mid": "/m/01d74z",
"description": "Night",
"score": 0.80408716,
"topicality": 0.80408716
},
{
"mid": "/m/01lwf0",
"description": "Alley",
"score": 0.7133322,
"topicality": 0.7133322
}
]
}
]
}
Go
Antes de probar este ejemplo, sigue las Go instrucciones de configuración de la guía de inicio rápido de Vision con bibliotecas de cliente. Para obtener más información, consulta la documentación de referencia de la API Go Vision.
Para autenticarte en Vision, configura las credenciales predeterminadas de la aplicación. Para obtener más información, consulta el artículo Configurar la autenticación en un entorno de desarrollo local.
// detectLabels gets labels from the Vision API for an image at the given file path.
func detectLabels(w io.Writer, file string) error {
ctx := context.Background()
client, err := vision.NewImageAnnotatorClient(ctx)
if err != nil {