XPENG has published TuringViT, a vision encoder for vision-language and vision-language-action models used in smart driving, smart cockpit systems and its