Gemini原生多模态实测:内容创作者为何抛弃GPT-4V

admin AI新闻 19

分别在最近的三个月期间, 我始终持续不断地在从事将几款主流的多模态大模型进行相互对照比较测试其实际呈现表现的相关工作。鉴于我自身身为一名创作工作一直很频繁地面对处理图文相互混合内容情况的内容创作者 , 我于 **喜爱AI(cx.xiaiai. com)**这类的充当AI模型聚合功能用以集中各方资源的平台之上把Gemini、GPT - 4V、Claude这几款模型都逐一进行尝试体验直至到全然熟悉全面了解的地步。结果令我感到十分出乎意料的是, Gemini这款模型当处于面对承接处理那些复杂程度较高的多模态任务工作要求时所展现出的那种具备的“理解的连贯性与衔接性”特质, 显著清晰地表明跟其他的那些同样参与测试活动开展实验的模型比较起来明显地处于不同的水准范畴层次 , 并非处于相同的水平线上。

这种差距并非性能方面的些许领先, 而是底层架构设计理念的明显差异。当我深入钻研Gemini的技术实现情况后发觉, Google运用“原生多模态”这一设计, 重新界定了下一代AI大模型应有的模样。

一、什么是"原生多模态"?为什么说它是新范式

好多人觉得多模态就是那可以去看图片, 能够听音频, 事实表明这不过便是表面呈现出来的状况。而真正存在区别的地方位于模型内部它对各种各样模态数据究竟是怎样去进行处理的。

传统的用作参照的多模态模型, 是以“拼装式”作为设计基础的: 首先运用一个视觉编码器将图片转化为相对应的特征向量, 继而借助一个“翻译层”将这些向量投射到语言模型能够领会的空间范围, 最终接入基于超大能力的语言模型来展开推理。这类似于你在查看一张照片时: 首先让某人用文字加以详细阐述后朗读给你听取, 而后你依据所听到的描述内容去回应问题。

Gemini的原生多模态架构全然不一样, 它在训练开始的初期, 便使图像、文本以及音频的数据流入同一个神经网络之内, 所有的模态在同一套Transformer结构当中一起学习, 这仿佛等同于你直接凭借眼睛去看, 依靠耳朵来听, 进而运用脑子同时去处理所有的信息, 并非是先将其转化成文字, 而后去理解。

我采用一个实际发生过的例子来进行对比, 把一张产品设计图呈现给模型去看, 提出让它指明设计当中存在的缺陷, 并且给出可以改进的建议。

传统模型, 其处理流程为, 视觉编码器提取图片特征, 映射层进而转成文本特征, 语言模型最终生成回答。在此一过程当中, 图片诸多, 譬如色彩搭配、元素间距、视觉层次的很详细细节信息, 在处于“翻译”阶段之时便丢失了。

Gemini的处理方式是, 将图像以及文本提示词一同进行输入, 模型内部存在的跨模态注意力机制, 使得视觉信息与语言信息能够直接产生交互, 在生成回答之际, 能够精确地引用图片里的特定元素。

测试呈现出的结果清晰明了: 在我向模型提出“把左上角按钮的圆角调整得大一些”这般要求的时候, 传统类型的模型常常没办法理解“左上角”所指向的是图里哪一处位置。然而那个名为Gemini的模型却能够精准地进行定位, 并且给出具备针对性的建议。

二、原生多模态架构的三大核心优势

是在持续进行测试这般的情形之下, 我发觉Gemini的原生多模态设计致使出现了三个关键能力方面的提升。

**第一,跨模态理解的精度更高。**

传统模型于处理“图文关联”任务之际, 常常会出现“看懂图然而接不上话”这般的情形。比如说, 给予一张代码截图, 询问“第15行的bug要怎么去修”, 模型或许能够识别出此乃代码, 可是极难精确地定位到具体是哪一行, 更勿论去剖析逻辑错误了。

Gemini 因属原生处理, 视觉信息于其模型内部, 与文本信息呈“平等”状态, 不存在一方翻译另一方之问题。我于测试之际发现, 其可精准理解仿若“图中红框标记的区域”、“左边第二个按钮”、“表格第三列数据”这般需精确视觉定位之指令。

**第二,多轮对话的上下文连贯性更强。**

这样的差异, 于长对话里头, 显著情况尤其突出, 仿佛我最初去上传一款产品原型之图了之后问的是这般设计存在何为问题, 紧接着进行追问是倘若变更成为深色模式会怎样, 随后又问的是那按钮的对比度足够不够。

传统模型于第二轮对话时, 常常得重新“回忆”图片内容, 于第三轮对话时亦是如此, 并且极易丢失先前分析的细节。Gemini 因图像信息一直存于模型的“工作记忆”之中, 所以多轮对话的连贯性显著更佳, 不会在回答过程中径直“忘了在谈哪张图”。

**第三,处理复杂场景的能力显著提升。**

最能展现出差距的, 是那些需要进行“跨模态推理”的任务, 像给出一张建筑设计图, 以及一段文字需求描述, 要求这一模型判定设计是不是符合需求, 并且指出哪些地方是不符合的。

在这类任务中, 模型是需要同时去理解视觉方面的信息的, 比如说图纸的布局, 尺寸, 还有结构方面的情况, 并且还要理解文本这边的信息, 像需求中的功能, 规格, 以及约束条件这些, 而且, 模型还要能够在这两者之间建立起精确的对应关系。传统模型在处在这种场景的时候, 其表现往往是那种好像对又好像不对的状态, 然而Gemini却能够给出更加具体的分析, 还更准确些。

三、从技术实现看为什么"原生"这么重要

好多人会发问: 要是拼装式架构同样能够达成多模态, 那为何一定要去弄原生多模态呢?

核心原因在于**信息损耗和对齐粒度**。

传统的那种拼装式架构, 从本质上来说, 是在进行“模态翻译”, 视觉编码器会将一张尺寸为1024×1024 的图片压缩成为一个几百维度的向量, 之后映射层又会把这个向量转化成为语言模型能够理解的token序列, 在这个过程当中, 大量的细粒度的视觉信息肯定会有所丢失。

更重要的是, 采用“先压缩再翻译”的这种方式意味着, 模型仅仅能够达成“整体语义对齐”, 而很难去实现“局部细节对齐”。比如说, 图片里存在“一只猫趴在键盘上”这种情形, 模型能够明白这其中有“猫”以及“键盘”, 不过却很难精准地理解“趴”这个姿态所对应的视觉特征究竟是什么。

Gemini的原生架构借助**统一的表征空间**化解了此问题, 图像、文本、音频于模型内部是以同一套token体系予以表示的, 不同模态的信息能够在同一个注意力机制之下直接展开交互, 这恰似你的大脑处理“所看到的红色”以及“所听到的警报声”, 并非要先将它们转变成统一的“中间语言”, 而是直接于神经元层面构建关联。

谷歌的论文当中提及, Gemini于训练之际运用了“交错多模态数据”, 也就是说, 图像token、文本token、音频token混合一块儿输入模型, 这般训练方式使模型从起始之时便学会了“跨模态思考”, 并非于后期再去补充此能力。

四、新范式带来的产业影响:谁会受益,谁会被淘汰

Gemini所开启的, 是原生多模态范式, 其影响的, 并非仅仅是技术路线, 而是更会去重塑整个关于AI应用的产业格局。

**短期内,会加速多模态应用的落地。**

曾经好些场景因多模态模型“理解不准确”致使无法实现商业化, 像医疗影像分析, 像工业质检, 像自动驾驶决策。原生多模态架构将跨模态理解的精度提升到了一个新高度, 这些应用的可行性会得到大幅提高。

我于近期所关注的那几个垂直领域, 像设计稿自动转代码, 视频内容审核, AR导航, 均已着手尝试接入Gemini类的原生多模态模型。就测试效果而言, 其准确率以及稳定性着实比先前使用的拼装式方案要好出许多。

**中长期看开云真人app在线登录开云app在线入口,会形成新的技术壁垒。**

从头做一个统一的多模态完整模型的原生多模态架构开发成本, 远远地高于去复用现成的视觉编码器以及语言模型的拼装式模型方案, 因为这意味着只有资源足够丰富, 并且具备长期投入能力条件这样的大厂才玩儿得起这件事 , 而不是去复用现成的视觉编码器和语言模型。

这会致使一种后果出现, 即头部玩家之间的技术代差会持续增大, 就如同当下众人都在开展大语言模型的研发工作, 然而真正能够达到GPT - 4、Claude这般水平的仅仅仅有几家, 往后多模态大模型发展也会趋向于类似的情形。

对于那些属于中小团队以及处于垂直场景下的创业公司, 更为实际可行的策略是, 在通用能力方面依靠大厂所拥有的原生多模态模型, 然而在垂直领域要开展深入的定制活动还有优化举措。有这样一种情况, 宁愿耗费资源去复刻Gemini的架构, 倒不如选择花些精力集中思索怎样利用好这些模型用以解决实际发生的具体问题的时候更妥善。

五、普通开发者和用户该怎么适应这个变化

最大可变化的是, 开发者而言原生多模态范式带来的, 这一可变化却是: **AI 的应用这一成为“标配”变为的再也不会仅仅在是其中多不了模态能力作为“附加项”了**。

以前做AI产品, 或许先弄出一个纯是文本的版本, 往后才思索要不要增添图像理解。眼下这趋势变了, 用户从一开始就期望你的产品能够达成“看懂图、听懂话、理解视频”这般的效果。要是你的产品依旧处在单模态的阶段, 那它的竞争力便会快速地下降。

从技术选型角度开云app官方最新下载地址,我的建议是:

首先, 要尽可能早些时候去测试原生多模态模型实际能够达到的能力极限边界范围, 切莫等到竞争对手的同样产品都已经广泛投入使用了才着手开始进行相关研究工作再去做。应当消耗一定的时进行各种尝试, 把Gemini、GPT - 4V这些在行业内占据主流地位的模型所提供的API逐一进行试验一遍, 以此了解它们在你自身所从事的业务场景当中究竟会呈现出怎样的表现情况。

第二, 对产品的交互方式予以重新设计。原生多模态模型最为突出的价值并非是“能够处理多种输入”, 而是倾向于“能够领会多种输入之间的关联”。你的产品设计务必要能对这一能力予以充分运用, 比如说能够让用户实现“边说边指”这一行为, 能够达成“看图说话”这种表现, 能够做到“对着视频提问”这般举动。

第三, 要留意模型的长久发展演进路径, Gemini当下所展现出的能力, 或许仅仅是原生多模态范式的1.0版本, 往后必定会出现更为强大的模型, 能够支持更多样的模态, 像是触觉、嗅觉等, 具备更长的上下文内容, 拥有更精微的掌控机制, 你的产品框架得拥有足够的灵活度, 从而能够迅速适配新的模型。

在普通用户看来的这个变化, 表明AI工具会变得更能领会其心意。以往对一个问题要用文字去费劲地描述, 如今能够直接采取截图、录屏、拍照的方式, AI就能够明白用意。这会促使AI由“工具”转变为“助手”, 切实融入日常从事の工作以及生活之中来。

六、写在最后:范式转换才刚刚开始

Gemini取得成功, 这证实了原生多模态架构具备可行性。然而, 这个范式转换, 当下才刚刚起始。

从技术层面来瞧, 仍存在诸多尚未解决的问题, 比如说怎样进一步削减训练所要耗费的成本, 怎样促使模型更优地去处理时长较长的视频, 怎样在确保性能稳定的状况下来压缩模型的规模。

在应用层面来看, 大多数行业仍处于探寻如何充分运用多模态 AI 的进程之中, 众多传统场景需对流程予以重新设计, 如此方能让原生多模态模型的价值得以展现出来。

不过, 有一点是明确的, 单模态人工智能的时代正趋于过去, 多模态人工智能的未来已然来临。那些能够预先领会这个趋向, 且在产品、技术以及商业模式方面做好筹备的团队, 会在后续的竞争里抢占先机。

对于平常人来讲, 当下乃是去体验以及学习多模态AI的最佳时候。这些技术已并非实验室里那种概念,而是每一个人都能够使用的工具。尝试运用它们去解决一些实际存在的问题, 你就会发觉AI已然比你所想象的更为强大, 并且也更为实用。

标签: 多模态AI 原生架构 Gemini GPT-4V 产业影响

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~