
本站推荐电影
本站推荐电视剧
电影下载排行
电视剧下载排行

一 | 今天,7月21号。 阿里发布了它最强的图像模型,Qwen-Image-3.0,接下来,估计你会看到一大堆实测;发布会官方的关键词,就一个字:实;内容丰实、细节真实、知识厚实;三个词,阿里自己给的答案。

二 | 但我想退一步,先问一个问题:图像模型发展到今天,到底在比什么? 搞懂这个,比看一场花里胡哨的演示重要得多。

三 | “大热天的,能在这么冰凉的水里游泳,太舒服了!而且水还清得见底。

四 | 为什么这么说? 过去几年,你对AI生图的印象,大概还停在「画得像不像、美不美」这一层。手指头画对了没,光影真不真实,AI味重不重。 这套比赛规则里,图像模型是个画师,考画功。”8月22日至23日,2026建德17℃新安江“夏日冬泳”轻极限运动挑战赛在建德火热举行,夺得游跑男子青年组冠军的上海选手王寅东兴奋地说。

五 | 可这场发布会,阿里声称的所有升级,指向的都不是画功。 是另一个指标:一张图里,能装下多少东西。 说一个最直观的数字。建德自2025年2月首次提出打造“轻极限运动之城”目标以来,迄今已布局轻极限运动项目45个,累计接待游客307万人次,带动综合消费超15亿元。提示词长度。

六 | 8月,随着2026建德“轻极限运动月”启幕,涵盖“水陆空”三大维度的10项赛事陆续展开。从江面到水下,从地面到天空,建德把整座城市变成了一座“天然运动场”。上一代Qwen-Image-2.0,一次最多吃进去1K token的指令。3.0直接拉到了4.5K。“水陆空”全面铺开的底气哪里来?何谓“轻极限运动”?夏日冬泳、低空跳伞、山地自行车、越野赛、漂流、桨板、自由潜……这些既具挑战又可亲近自然的运动项目,在建德被集中呈现。它们保留了极限运动对技巧和勇气的考验,但门槛更低、风险更可控,普通人经过专业指导即可“试水”。翻了4.5倍。

七 | 这意味着什么? 过去你给图像模型下指令,只能压成一句话。这个定位恰好踩中了当下年轻人“想玩又不敢玩太狠”的心理区间。现在你可以像给设计师写需求文档一样,把画面结构、文字内容、排版细节,完整地写进去。 发布会现场演示的一条提示词,3700个token,折合约13000个字符。建德系统梳理出了覆盖“水陆空”全维度的“轻极限运动”版图。什么概念?一份小型说明书的体量。

八 | 水上,新安江常年保持14℃—17℃的恒温,盛夏入水体感冰凉,这种强烈的温差体验,催生了“夏日冬泳”IP。“这里的水不仅冰冰凉凉,还会冒烟,从来没有见过。 这份说明书生成了什么? 一张九宫格。九个格子,九个不同学科的知识图解。”不久前,来建德参加“轻极限运动月”赛事发布会的世界游泳冠军杨丽娜说。水温恒定、水质清澈,也让桨板、自由潜有了常年开展的条件。

九 | 陆上,76%的森林覆盖率提供了天然氧吧般的生态环境,喀斯特地貌则雕琢出溶洞、峰林、陡崖等多样地形。数学公式、几何图形、逻辑推导,各画各的,互不串门。

十 | 一条指令,一次生成。乾潭有穿梭于竹海山林之间的勇峰专业山地自行车速降赛道,寿昌有亚洲最大楠木林。空中,浙江省首张A类通用机场许可证、5700平方公里华东地区最大低空飞行空域,让跳伞、航空模型、无人机足球有了施展的空间。 作为对照,现场把同一条提示词喂给了2.0;超出1K限度之后,模型就开始「胡字」,连九宫格的框都排错了位置。近年来,建德先后承办F3A世界杯、全国航空模型公开赛。

十一 | 建德把这些天然赛道一个一个开发出来,并在地图上标出了45个坐标。比如,水之极潜水酒店建有42米华东地区最深潜池,自去年9月开业以来已接待游客3.8万人次。中国自由潜水竞技运动员王奥林评价:“这座潜水馆的体量、配套设施、工作人员专业度,在我接触过的场馆中都属于顶尖水准。

十二 | 另一组演示往纵深走,让模型生成一个VSCode编程界面,界面里打开着千问App,App的聊天窗口里躺着一张手冲咖啡海报。 三层界面套娃,每一层的结构和风格都要对,最里层海报上的文字还得清晰可辨。”40万立方米水体规模,不少运动员赛前70%的训练任务可在这里完成。“尝鲜型”运动,如何持续?建德今年首次推出的“轻极限运动月”,是对“品牌化”的一次集中试探——10项赛事从8月持续到9月,试图用高频次、多品类的节奏,测试哪些项目能跑出来、能被记住。轻极限运动的主战场在景区、水域和航空小镇,但建德的谋划不止于专业赛道——他们想把赛事和活动引向更广阔的乡村场景,让运动成为激活村庄的“一把火”。

十三 | 官方演示里,手机截图上的时间数字,小到只有10个像素,现场还把一张YouTube界面图放大20倍来看,这些字小到只占原图的1%,字字可辨。乡村山水是轻极限的天然赛场。

十四 | 近日,2026勇峰自行车速降赛第三站在乾潭镇开赛。 把这些演示摆在一起,动作是同一个: 往一张图里塞进更多的东西。更长的指令、更多的画面、更深的嵌套、更小的字;塞进去,还要保证每个字都是对的。赛道所在的下包村配套有天然泳池、胥溪水域和草坪露营基地——赛事引流,乡村接客,一场速降赛就是一次山村“导流”实践。目前,投资30亿元的富龙国际冰雪运动基地项目正有序推进,将填补建德冬季冰雪旅游的空白。 这就是「实」的人话版本:信息密度;图像模型比赛项目,正在从「画得好不好」,换成「装得下,装不下」。 ...... 问题来了:一张图塞这么满,给谁看?谁买单? 这就要算一笔账了,图像模型这门生意,主流模式简单到有点原始:按产出量。 我查了一下现在市面上的计费方式。国内厂商的图像API,普遍按张收费,生成一张收一张的钱。 OpenAI的GPT-Image-2按token计费,产出的图越多越大,token烧得越多。名目不同,骨架是同一副:客户为产出的量买单。 阿里的3.0目前还在公测申请阶段,没有定价;不过,记住「按量收钱」这四个字。建成之后,建德有望实现“春踏青、夏戏水、秋越野、冬滑雪”的全季全时运动体验。建德市文广旅体局发布的一组数据显示:马岭天观景区引入高空秋千后,游客平均年龄从45岁降到30岁,二次消费占比升至70%;勇峰自行车公园山地速降复购率达70%;航空小镇跳伞复购率约为15%。我们再回头看发布会上一个不起眼的案例。 讲商业化的架构师举了短剧行业: 过去客户做一部短剧的前期素材,人设图、场景图、每个镜头的分镜图,要一张一张生成,几十张起步。现在这些元素可以融在一张图里,一次出完。 官方的原话:过去生成几十张图的事,今天一张搞定。 这笔账发布会没有算下去,我替它算完;按量计费的模式下,几十张变一张,客户这个环节的账单就压到了原来的几十分之一,单价一分没动,客户掏的钱少了一个数量级。

十五 | 这不是短剧一个行业的特例。

十六 | 讲到办公场景时,同一位架构师又算了一笔时间的账:过去自己调一个复杂的PPT页面,字号、字距、排版一处处抠,要半小时甚至一小时,用3.0生成,最快半分钟。三组数据指向一个结论:年轻人确实买账,但“尝鲜型”消费仍然占大头。如何把“来一次”的人变成“来很多次”的人,是轻极限运动从“网红打卡”走向“长期目的地”的关键一跃。 张数的账、时间的账,算的是同一件事:图的信息密度越高,客户为一份可用素材付出的成本就越低。

十七 | C端是同一个逻辑的零售版。 发布会上,千问App的产品经理举的例子是手帐和社媒封面;过去要找模板、挑图、拼字、调排版,做到一半就想放弃。现在一句话丢给模型,文字、排版、贴图一次成型。

十八 | 企业省账单,个人省那个熬夜拼图的晚上,这大概就是信息密度在商业上的真实身份:一种不打价格战的降价。 直接降单价是价格战,人人都会,也人人都伤,把降价做成技术能力就不一样了:一张图装得下九张图的内容,等于用一张的价格卖九张的货。 而这个折扣,只有装得下的模型给得起,想给同样折扣的对手,得先把4.5K token的长指令、互不干扰的排版这些能力做出来。 降价,被做成了门槛。 这也解释了为什么发布会把GPT-Image-2挂在嘴边。那是目前公认的天花板,也是把文字渲染、信息图当主打能力的模型。 两家瞄着的是同一个方向:图不再是画,可以直接商用的信息载体。 方向对不对,市场用脚投票;各家走到哪一步,得看第三方的尺子。 这里如实交代一句:阿里闭源旗舰没有上过第三方盲测榜,今天「仅次于GPT Image」的信息,来自自家评测,毕竟还没放出来。 但这笔降价的账,往下多想一步,会碰到一个悬着的问题: 按量计费的生意,收入等于单价乘以量;信息密度把客户要买的量压掉一个数量级,单价又没人敢涨。这门生意的收入,以后从哪里长出来?我不知道。 能确定的只有一件事:这个能往图里塞东西的本事,正在变成竞争的胜负手。 ...... 既然是胜负手,为什么偏偏只有这几家能做到?因为回头看那些演示,考的都不是画笔。 把10个像素的字写对,考模型认不认识这个字。九个学科各画各的、互不串门,考它知不知道对数函数长什么样、蜻蜓的翅膀分几节。 三层界面套娃不乱,考它捋不捋得清「界面里的App里的聊天窗里的海报」这种嵌套关系;这些能力拼在一起,有一个统一的名字:语言模型的能力。 文字渲染、世界知识、长指令理解、逻辑结构,没有一样是传统图像模型的看家本领,全是从大语言模型那边外溢过来的。 外溢还有一个更直接的证据:编辑。

十九 | 这一代模型把生图、编辑做进了同一个架构。官方的说法是,文生图里积累的文字渲染、细节质感和世界知识,会自然迁移到编辑场景。 所以,你能看到古画修复前后文字不丢、手绘草图直接转成PPT这类演示;能迁移,说明这些本事长在底下那个理解世界的模型里。

| 另外,线上发布时,有一句话值得单独摘出来。 演示九宫格时,技术负责人说,这个case试了目前市面上的模型,只见到两个能做到;一个是千问3.0。

| 另一个他没点名,语境里指向GPT-Image-2。 注意这两家,都是先把语言模型做进第一梯队,再回头做图像的公司。 牌桌上剩下这两位,不是巧合,图像模型的门槛,已经挪到了语言那一侧。 发布会的结尾也在往同一个方向指,外部嘉宾被问到还期待什么,他说:「我发一张图给你,你捣鼓完直接返我十张能用的。

| 」 技术负责人接的词是agentic image generation。他管这叫三思而后行:一思用户意图,二思收集素材,三思整合统筹。最后才轮到生成。

| 四步里,前三步全是语言模型的活;生成,那个我们以为的主角,排在最后一步。

| 我翻了翻这条产品线的发布记录,商业身段的变化也对得上。 1.0在2025年8月发布时是开源的,那是千问递给开源社区的一张名片;2.0起,旗舰不再开源。到今天的3.0,直接走API公测申请。 开源线没有断,早先的编辑模型至今仍是开源阵营里最能打的,只是旗舰收进了柜台。 会画图的模型,开源社区里已经不稀缺了;会读需求文档的模型,稀缺,收进柜台的是后者。 90分钟的发布会,讲一个图像模型,拆到最后,图像可能只是入口,一个「实」字背后,是提示词变成需求文档,一张图当九张图卖,是画画的本事让位给读题的本事。 再往前一步,问题就变成了: 当塞图的能力全部来自语言,图像模型还是一个独立的物种,还是语言模型的一个输出头? 这个问题很有意思。不过看演示的方向,阿里自己可能也在思考。它只是把每一步都往「更实」的方向踩,踩到哪算哪。

| 我先把我听到、理解后的思考发出来;回头体验一下,也许会有新想法。
Current article:http://5fvzv46.suilaoheirenzhaizhaikang.sbs/zz4kgo/v4e1.html
Published on:04:35:56