微软公布多模态模型MM-Navigator，基于GPT-4V研发

据 Arxiv 页面显示，微软近日联手加州大学等高校，共同发布一款多模态大模型产品 MM-Navigator。

MM-Navigator基于 GPT-4V打造，可用于零镜头智能手机 GUI 导航任务。通过使用 MM-Navigator，智能手机屏幕可以像人类用户一样进行交互，并确定后续行动以完成给定的指示。

研究发现，多模态大模型在零镜头 GUI 导航方面表现出色，尤其是 GPT-4V，它具有先进的屏幕解释、行动推理和精确行动定位能力。

免责声明：本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿，凡在本网站出现的信息，均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性，但不保证有关资料的准确性及可靠性，读者在使用前请进一步核实，并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏，概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时，可联系本站进行审核删除。

一	二	三	四	五	六	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30

微软公布多模态模型MM-Navigator，基于GPT-4V研发

相关推荐

发表回复