Google Cloud 在 Cloud TPU 上为长上下文多模态嵌入推理实现企业级精度Google Cloud 将原生 TPU 支持集成进 vLLM,并针对 Qwen3 Embedding 模型系列优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理。摘要Google Cloud 将原生 TPU 支持集成进 vLLM,并针对 Qwen3 Embedding 模型系列优化,在 Cloud TPU 上实现长上下文(文本 4K+、多模态 15K+ tokens)多模态嵌入推理。原文链接Google Developers Blog(RSS)AI HOT 详情页