摘要
Apple 机器学习研究团队提出一种方法,让视觉语言模型(VLM)仅从图像集示例中推断视觉概念,无需文本指令。该方法通过对比示例图像与候选图像,使模型捕捉颜色、纹理等视觉规律,在多个概念推理基准上提升准确率。该研究目前为学术论文,未公布模型或 API 可用性。
Apple 机器学习研究团队提出一种方法,让视觉语言模型(VLM)仅从图像集示例中推断视觉概念,无需文本指令。该方法通过对比示例图像与候选图像,使模型捕捉颜色、纹理等视觉规律,在多个概念推理基准上提升准确率。该研究目前为学术论文,未公布模型或 API 可用性。