Mensaje de Gate News, 23 de abril — investigadores de Google, incluidos He Kaiming y Xie Saining, publicaron un artículo que presenta Vision Banana, un modelo general de comprensión visual creado mediante un ajuste fino ligero de instrucciones del modelo de generación de imágenes Nano Banana Pro (Gemini 3 Pro Image) de la empresa. La innovación clave unifica las salidas de todas las tareas de visión como imágenes RGB, lo que permite segmentación, estimación de profundidad y predicción de normales de superficie mediante generación de imágenes sin arquitecturas ni funciones de pérdida específicas de cada tarea.
En segmentación semántica, Vision Banana superó al modelo especializado SAM 3 en 4.7 puntos porcentuales en Cityscapes; en segmentación por expresiones referenciales, superó a SAM 3 Agent. Sin embargo, quedó por detrás de SAM 3 en la segmentación de instancias. Para tareas 3D, la estimación métrica de profundidad logró una precisión media de 0.929 en cuatro conjuntos de datos estándar, superando el 0.918 de Depth Anything V3, usando solo datos sintéticos sin información real de profundidad ni parámetros de cámara durante la inferencia. La estimación de normales de superficie logró resultados de vanguardia en tres benchmarks del interior.
El ajuste fino implicó un conjunto mínimo de datos de tareas de visión mezclado en el entrenamiento original de generación de imágenes, preservando las capacidades de generación del modelo: el rendimiento coincidió con el Nano Banana Pro original en pruebas de calidad de generación. El artículo propone que el preentrenamiento de generación de imágenes en visión es análogo al preentrenamiento de generación de texto en lenguaje: los modelos aprenden las representaciones internas necesarias para la comprensión de imágenes durante la generación, y el ajuste fino de instrucciones solo libera esta capacidad.
Aviso legal: La información de esta página puede proceder de terceros y no representa los puntos de vista ni las opiniones de Gate. El contenido que aparece en esta página es solo para fines informativos y no constituye ningún tipo de asesoramiento financiero, de inversión o legal. Gate no garantiza la exactitud ni la integridad de la información y no se hace responsable de ninguna pérdida derivada del uso de esta información. Las inversiones en activos virtuales conllevan riesgos elevados y están sujetas a una volatilidad significativa de los precios. Podrías perder todo el capital invertido. Asegúrate de entender completamente los riesgos asociados y toma decisiones prudentes de acuerdo con tu situación financiera y tu tolerancia al riesgo. Para obtener más información, consulta el
Aviso legal.
Artículos relacionados
Un prestigioso despacho de abogados cobra más de 2.000 dólares por hora; documentos judiciales quedaron expuestos por “alucinaciones de IA y errores por todas partes”
El bufete de abogados de primera línea de Estados Unidos, Sullivan & Cromwell, emitió una disculpa ante el juez por aproximadamente treinta errores generados por IA, casos falsos y disposiciones inventadas que aparecieron en los documentos judiciales presentados por el caso de quiebra de Manhattan del que se trata. Aunque existen honorarios altos por hora y políticas internas de capacitación, al preparar el material no se aplicó una revisión, lo que volvió a desatar el debate sobre el uso de la IA en el ámbito legal y la responsabilidad ética.
ChainNewsAbmediaHace3m
DeepSeek hace de código abierto TileKernels, biblioteca de kernels de GPU para el entrenamiento e inferencia de modelos grandes
Noticias de Gate, 23 de abril — DeepSeek ha hecho de código abierto TileKernels bajo la licencia MIT, una biblioteca de kernels de GPU escrita en TileLang para el entrenamiento y la inferencia de modelos de lenguaje de gran tamaño. TileLang es un lenguaje específico de dominio desarrollado por el equipo tile-ai para expresar kernels de GPU de alto rendimiento en
GateNewsHace12m
Samsung SDS amplía su asociación con Google Cloud para atender sectores regulados con servicios de IA y seguridad
Mensaje de Gate News, 23 de abril — Samsung SDS amplió su asociación con Google Cloud para ofrecer servicios de IA, computación en la nube y seguridad a industrias reguladas, incluidos el gobierno y los servicios financieros.
Las empresas implementarán Google Distributed Cloud para clientes que requieran localización de datos
GateNewsHace35m
Sullivan & Cromwell se disculpa por alucinaciones de IA en un escrito judicial con 40 citas erróneas
Mensaje de Gate News, 23 de abril — Sullivan & Cromwell, un importante despacho de abogados de Wall Street, se disculpó ante un juez federal después de presentar un escrito judicial que contenía aproximadamente 40 citas incorrectas y otros errores provocados por alucinaciones de IA. Andrew Dietderich, codirector del equipo global de reestructuración del despacho
GateNewsHace51m
Tencent lanza y abre código de la vista previa de Hunyuan Hy3 con 295B de parámetros
Mensaje de Gate News, 23 de abril — Tencent presentó y lanzó como código abierto una vista previa de Hunyuan Hy3, un modelo de lenguaje híbrido de mezcla de expertos (MoE) que incorpora la fusión entre pensamiento rápido y lento. El modelo consta de 295 mil millones de parámetros totales con 21 mil millones de parámetros activos, y admite una longitud máxima de contexto de 256K
GateNewshace1h
Corea del Sur y Vietnam firman 70+ memorandos de entendimiento sobre IA, energía e infraestructura de datos
Mensaje de Gate News, 23 de abril — Corea del Sur y Vietnam firmaron más de 70 memorandos de entendimiento (MOUs) durante la visita de Estado del presidente Lee Jae Myung a Hanói el 23 de abril, abarcando IA, energía, infraestructura y telecomunicaciones. Un foro empresarial al que asistieron más de 500 ejecutivos discutió el ecosistema de IA y de la industria energética, con grandes conglomerados coreanos como Samsung, SK, LG y Hyundai representados.
GateNewshace1h