如果我爱你
硬派越野SUV 非承载式车身+三把锁 捷途纵横G700申报信息_我的网站

A | 今天,7月21号。

B | 同时,根据此前消息来看,新车将于三季度正式上市。

C |
友情提示:如果您有新车谍照/新车爆料,请点击编辑头像(仅限App)私信给我们,期待您的来信。 阿里发布了它最强的图像模型,Qwen-Image-3.0,接下来,估计你会看到一大堆实测;发布会官方的关键词,就一个字:实;内容丰实、细节真实、知识厚实;三个词,阿里自己给的答案。

D | 为什么这么说? 过去几年,你对AI生图的印象,大概还停在「画得像不像、美不美」这一层。

E | 手指头画对了没,光影真不真实,AI味重不重。新车配备越野风格前保险杠,拥有较大的接近角,能够带来不错的通过性。 这套比赛规则里,图像模型是个画师,考画功。可这场发布会,阿里声称的所有升级,指向的都不是画功。 是另一个指标:一张图里,能装下多少东西。车身侧面来看,前翼子板处配备了捷途纵横专属LOGO,配备全地形AT轮胎,能够在野外环境中提供充足的抓地力。

F | 说一个最直观的数字。这款车的长宽高分别为5198/2050/1956毫米,轴距为2870毫米。

G | 车辆尾部带有外挂备胎,竖置尾灯带来更高的辨识度。

H | 动力方面,新车将搭载混动系统,配备2.0T纵置混动专用发动机,发动机最大功率155kW,系统总功率为560kW,总扭矩为795牛·米,传动系统匹配最新一代混动变速箱,官方表示其满油满电续航将达到1400km。上一代Qwen-Image-2.0,一次最多吃进去1K token的指令。(文/ 姚宇)

I | 现在你可以像给设计师写需求文档一样,把画面结构、文字内容、排版细节,完整地写进去。 发布会现场演示的一条提示词,3700个token,折合约13000个字符。什么概念?一份小型说明书的体量。 这份说明书生成了什么? 一张九宫格。九个格子,九个不同学科的知识图解。数学公式、几何图形、逻辑推导,各画各的,互不串门。一条指令,一次生成。 作为对照,现场把同一条提示词喂给了2.0;超出1K限度之后,模型就开始「胡字」,连九宫格的框都排错了位置。 另一组演示往纵深走,让模型生成一个VSCode编程界面,界面里打开着千问App,App的聊天窗口里躺着一张手冲咖啡海报。 三层界面套娃,每一层的结构和风格都要对,最里层海报上的文字还得清晰可辨。 官方演示里,手机截图上的时间数字,小到只有10个像素,现场还把一张YouTube界面图放大20倍来看,这些字小到只占原图的1%,字字可辨。 把这些演示摆在一起,动作是同一个: 往一张图里塞进更多的东西。更长的指令、更多的画面、更深的嵌套、更小的字;塞进去,还要保证每个字都是对的。 这就是「实」的人话版本:信息密度;图像模型比赛项目,正在从「画得好不好」,换成「装得下,装不下」。

J | ...... 问题来了:一张图塞这么满,给谁看?谁买单? 这就要算一笔账了,图像模型这门生意,主流模式简单到有点原始:按产出量。 我查了一下现在市面上的计费方式。

K | 国内厂商的图像API,普遍按张收费,生成一张收一张的钱。

L | OpenAI的GPT-Image-2按token计费,产出的图越多越大,token烧得越多。

M | 名目不同,骨架是同一副:客户为产出的量买单。 阿里的3.0目前还在公测申请阶段,没有定价;不过,记住「按量收钱」这四个字。我们再回头看发布会上一个不起眼的案例。 讲商业化的架构师举了短剧行业: 过去客户做一部短剧的前期素材,人设图、场景图、每个镜头的分镜图,要一张一张生成,几十张起步。现在这些元素可以融在一张图里,一次出完。 官方的原话:过去生成几十张图的事,今天一张搞定。 这笔账发布会没有算下去,我替它算完;按量计费的模式下,几十张变一张,客户这个环节的账单就压到了原来的几十分之一,单价一分没动,客户掏的钱少了一个数量级。 这不是短剧一个行业的特例。 讲到办公场景时,同一位架构师又算了一笔时间的账:过去自己调一个复杂的PPT页面,字号、字距、排版一处处抠,要半小时甚至一小时,用3.0生成,最快半分钟。 张数的账、时间的账,算的是同一件事:图的信息密度越高,客户为一份可用素材付出的成本就越低。 C端是同一个逻辑的零售版。 发布会上,千问App的产品经理举的例子是手帐和社媒封面;过去要找模板、挑图、拼字、调排版,做到一半就想放弃。现在一句话丢给模型,文字、排版、贴图一次成型。 企业省账单,个人省那个熬夜拼图的晚上,这大概就是信息密度在商业上的真实身份:一种不打价格战的降价。 直接降单价是价格战,人人都会,也人人都伤,把降价做成技术能力就不一样了:一张图装得下九张图的内容,等于用一张的价格卖九张的货。 而这个折扣,只有装得下的模型给得起,想给同样折扣的对手,得先把4.5K token的长指令、互不干扰的排版这些能力做出来。 降价,被做成了门槛。 这也解释了为什么发布会把GPT-Image-2挂在嘴边。那是目前公认的天花板,也是把文字渲染、信息图当主打能力的模型。

N | 两家瞄着的是同一个方向:图不再是画,可以直接商用的信息载体。 方向对不对,市场用脚投票;各家走到哪一步,得看第三方的尺子。 这里如实交代一句:阿里闭源旗舰没有上过第三方盲测榜,今天「仅次于GPT Image」的信息,来自自家评测,毕竟还没放出来。 但这笔降价的账,往下多想一步,会碰到一个悬着的问题: 按量计费的生意,收入等于单价乘以量;信息密度把客户要买的量压掉一个数量级,单价又没人敢涨。

o | 这门生意的收入,以后从哪里长出来?我不知道。 能确定的只有一件事:这个能往图里塞东西的本事,正在变成竞争的胜负手。 ...... 既然是胜负手,为什么偏偏只有这几家能做到?因为回头看那些演示,考的都不是画笔。 把10个像素的字写对,考模型认不认识这个字。九个学科各画各的、互不串门,考它知不知道对数函数长什么样、蜻蜓的翅膀分几节。 三层界面套娃不乱,考它捋不捋得清「界面里的App里的聊天窗里的海报」这种嵌套关系;这些能力拼在一起,有一个统一的名字:语言模型的能力。 文字渲染、世界知识、长指令理解、逻辑结构,没有一样是传统图像模型的看家本领,全是从大语言模型那边外溢过来的。

p | 外溢还有一个更直接的证据:编辑。 这一代模型把生图、编辑做进了同一个架构。

q | 官方的说法是,文生图里积累的文字渲染、细节质感和世界知识,会自然迁移到编辑场景。 所以,你能看到古画修复前后文字不丢、手绘草图直接转成PPT这类演示;能迁移,说明这些本事长在底下那个理解世界的模型里。 另外,线上发布时,有一句话值得单独摘出来。 演示九宫格时,技术负责人说,这个case试了目前市面上的模型,只见到两个能做到;一个是千问3.0。另一个他没点名,语境里指向GPT-Image-2。 注意这两家,都是先把语言模型做进第一梯队,再回头做图像的公司。

r | 牌桌上剩下这两位,不是巧合,图像模型的门槛,已经挪到了语言那一侧。 发布会的结尾也在往同一个方向指,外部嘉宾被问到还期待什么,他说:「我发一张图给你,你捣鼓完直接返我十张能用的。」 技术负责人接的词是agentic image generation。他管这叫三思而后行:一思用户意图,二思收集素材,三思整合统筹。最后才轮到生成。 四步里,前三步全是语言模型的活;生成,那个我们以为的主角,排在最后一步。 我翻了翻这条产品线的发布记录,商业身段的变化也对得上。 1.0在2025年8月发布时是开源的,那是千问递给开源社区的一张名片;2.0起,旗舰不再开源。到今天的3.0,直接走API公测申请。 开源线没有断,早先的编辑模型至今仍是开源阵营里最能打的,只是旗舰收进了柜台。 会画图的模型,开源社区里已经不稀缺了;会读需求文档的模型,稀缺,收进柜台的是后者。 90分钟的发布会,讲一个图像模型,拆到最后,图像可能只是入口,一个「实」字背后,是提示词变成需求文档,一张图当九张图卖,是画画的本事让位给读题的本事。 再往前一步,问题就变成了: 当塞图的能力全部来自语言,图像模型还是一个独立的物种,还是语言模型的一个输出头? 这个问题很有意思。不过看演示的方向,阿里自己可能也在思考。

s | 它只是把每一步都往「更实」的方向踩,踩到哪算哪。 我先把我听到、理解后的思考发出来;回头体验一下,也许会有新想法。
Current article:http://www.ninyakenhongnian.sbs/c3b5/77k56i.ppt
Published on:15:01:55
