¿Qué es la Visión Por Computadora?
Es el estudio de algoritmos y sistemas que permiten a las computadoras emular la visión humana para interpretar datos visuales.
¿Cuál es la formula para saber cuanto pesa una imágen en bytes?
Tamaño = (Ancho*Alto*Profundidad)/8
Objetivo del Bajo Nivel
Reducción de ruido, corrección de iluminación, realce de bordes y mejora de contraste.
Un bit es...
Es la unidad mínima e indivisible de información en informática y comunicaciones digitales.
Si la cámara web del laboratorio captura video a una resolución de 640 x 480 píxeles y un objeto se encuentra exactamente en la esquina inferior derecha, ¿cuáles son sus coordenadas numéricas?
Sus coordenadas exactas son X = 640 y Y = 480. En visión artificial, el origen (0,0) está arriba a la izquierda, por lo que el punto máximo en horizontal corresponde al ancho (640) y el máximo en vertical corresponde al alto (480).
¿Cuál es la diferencia de VPC de Procesamiento de imágenes?
La visión busca la extracción de metadatos o información simbólica
Resolución de una pantalla 4K
3840p x 2160p
¿Qué hace el Medio Nivel?
El paso donde la imagen se convierte en datos. La entrada es una imagen, pero la salida son atributos extraídos (vectores de características).
Las imágenes son...
Una matriz de pixeles
¿Qué significa que las coordenadas entregadas por la Inteligencia Artificial estén "normalizadas" (valores flotantes entre 0.0 y 1.0) y por qué representan una ventaja para los modelos de IA?
Significa que la ubicación del punto es porcentual y no depende de la pantalla. Es una ventaja porque permite que el mismo modelo matemático funcione de manera idéntica si se conecta una cámara con resolución baja (320 x 240), una de alta definición (1920 x 1080), o si se escala la imagen, sin tener que reentrenar la red neuronal.
¿Cómo se llama el proceso de convertir una señal de luz continua en una rejilla finita de puntos?
Muestreo espacial.
Resuelve
Imagen de 640p × 480p
Profundidad de 8Bits
307,200 bytes o 0.29 MB
Funciones de Alto Nivel
¿Cómo podemos saber cuantos pixeles tiene una imagen?
Multiplicando el alto y el ancho de la resolución
Si un punto de MediaPipe entrega una coordenada normalizada de X = 0.75 y Y = 0.25 en una pantalla con resolución de 1280 x 720, ¿cuál es el cálculo matemático para obtener su posición real en la matriz?
Se multiplica cada componente flotante por la dimensión correspondiente de la pantalla:
X_real = 0.75 x 1280 = 960
Y_real = 0.25 x 720 = 180
La posición real en píxeles es la coordenada (960, 180).
¿Qué colores hay en un pixel?
Rojo, Verde y Azul
Resuelve:
Imagen de 7680p x 4320p
Profundidad de 24Bits
99,532,800 bytes o 94.92 MB
Resultado del nivel medio de procesamiento
Se generan listas de coordenadas, etiquetas de objetos y descriptores matemáticos.
Tarea clave de la extracción de atributos
Segmentación: Separar objetos de interés del fondo (binarización). Calcular el área, el perímetro, la redondez o la textura de las regiones segmentadas.
¿Qué error de software ocurre si intentamos dibujar un círculo con OpenCV utilizando directamente una coordenada normalizada (por ejemplo, 0.5) en lugar de la coordenada desnormalizada?
Ocurre un error de tipo (TypeError) o un fallo en las funciones gráficas de OpenCV, ya que las funciones de dibujo exigen estrictamente valores de tipo entero (integer) que apunten a un píxel físico existente en la matriz, y no valores decimales (float).
¿Cuántos y cuáles son los niveles de Procesamiento hay?
3 (Bajo, Medio, Alto)
Resuelve
Imagen de 12000p × 800p
Profundidad de 48Bits
576,000,000 bytes o 549.32 MB
Redes neuronales, clasificadores estadísticos y lógica difusa.
¿Cuál seria el orden del procesamiento de imagen?
Bajo Nivel (Pre-Procesamiento)-> Medio Nivel (Extracción de Atributos)-> Alto Nivel (Interpretación)
Al reajustar el tamaño de un frame mediante cv2.resize(frame, (300, 300)) para ingresarlo al modelo MobileNet-SSD, ¿qué sucede con la relación de aspecto original de la cámara y cómo afecta a las coordenadas resultantes?
La imagen sufre una deformación (se estira o aplasta) si la cámara original no era cuadrada. Las coordenadas resultantes de la IA se basarán en ese entorno de 300 x 300, por lo que obligatoriamente deben ser re-escaladas de vuelta a las dimensiones originales de la cámara para que los rectángulos encajen con los objetos reales.