Agent 感知与输入层:从多模态 VLM 到 GUI Agent 的"眼睛"进化之路
系统拆解 Agent 五层架构第 4 层——感知与输入层:从多模态 VLM 的发展历程(CLIP→Flamingo/BLIP-2/LLaVA→Gemini/GPT-4o 原生多模态)与视觉 tokenization 底座,到 GUI 感知三条接口(DOM/AXTree/截图),再到 OmniParser 屏幕解析与 UI-TARS 原生 GUI Agent 模型,以及感知评测基准与工程挑战,并以 LogicAI2 为例给出文本型 Agent 的感知扩展路径。