8 月 7 日,xAI 把「能用」的图片模型放进 grok.com

xAI 在 8 月 7 日正式推出 Grok Imagine Image 2.0,新模型以 Quality Mode 形式在 grok.com/imagine 与 iOS / Android 客户端全面 GA,API 同步开放,模型名 (官方发布页)。

和上一代纯炫技不同,2.0 的核心目标是「能用在真实工作里」:严格遵循 prompt 细节、设计师级的版式排版、跨代生成时保持视觉一致性。换句话说,xAI 不再卖「生成得好看」,开始卖「生成得」。

编辑能力第一次被当成 first-class 看待

官方把编辑能力单列了一节「Precise editing」,而不是塞进生成能力后面:

  • Magic wand + Segmentation:点哪改哪,只动指定区域,其余像素不动;
  • Background removal:主体一键导出透明背景,可直接拼到下游设计;
  • Multi-ref editing:单次生成支持最多 5 张输入图 —— 不再需要手动 PS 拼合;
  • Smart resize:同一张图按 1:1 / 2:3 / 9:16 / 16:9 等比例重新构图,模型自己补画面,而不是裁切。

配套的是 Templates:把常见工作流(Photo Edit、Product Color Change、Editorial Product Poster、Reimagine、Photo Collage、Mascot Maker、BG Removal & Change、E-Commerce Photos、UGC Photos、Professional Headshot、Icon Maker、Character Sprite、Props & UI Kit、Emoji Creator、Merch Maker)打包成「输入→成品」的工作流节点。

跨代一致性:为视频做「世界观」

xAI 把 Image 2.0 定位为「Grok 视频的脚手架」。在「Build a world for video」一节里,官方演示了用同一组 prompt 依次生成一个角色、若干地点、若干道具,再让该角色在雪地、风暴、隧道不同环境下出现——人物外观、画风、道具细节跨图保持一致

这正是当前视频生成最痛的「跨镜头一致性」问题。Image 2.0 的解法是先在静态图层面把世界观固定下来,再交给 Grok Imagine Video。这条路和 Seedream / Seedance 2.5 的「图像→视频」产线思路高度一致。

成绩单:Arena 双榜第二

官方披露,Image 2.0 在 Image Edit ArenaText-to-Image Arena 两个公开榜上都排到 世界第二,仅次于 OpenAI gpt-image-2。xAI 模型在 Arena 上以「SpaceXAI」名义登记(统计截至 8 月 7 日)。

第三方 Neura Market 8 月 7 日的报道也印证了这一排名,并补充了 Smart resize、多参考输入、区域级编辑等新功能(Neura Market)。

行业含义:文生图的竞争重心,正在从「生成」转向「可生产」

把这次发布放在 2026 下半年的版图里看,信号比模型本身更重要:

  1. 「能用」比「好看」贵。xAI 在官方页里反复用「real work」「real creative work」,意味着它开始把设计/电商/营销团队当作目标用户,而不只是创作者尝鲜。
  2. 编辑能力变成主战场。Qwen-Image-2.0、Seedream 5.0、Grok Image 2.0 这一波都在押注「multi-ref + region edit」,新一轮的文生图差异化已经从「生得像不像」挪到「改得准不准」。
  3. 为视频铺路是隐线。当 ByteDance Seedance 2.5、京东 JoyAI-Video-Edit 把视频拉进 30 秒时代,谁能先把视觉资产一致性固化下来,谁就能在视频端拿到杠杆。Grok 这条 Image 2.0 → Imagine Video 的链路,正是同样的产品逻辑。

谁能用、怎么用

所以呢:文生图战场还没分出胜负,「单张图像的修图生产力」会是接下来 6 个月分化的关键指标。Grok Image 2.0 把编辑能力做成 first-class + Arena 双榜第二,意味着 xAI 不再只想做 Grok 的「图像皮肤」,而是要在设计师的日常工具链里挤一个位置。对国内玩家(Qwen / Seedream / 智谱)来说,跨代一致性和模板化工作流,可能是下半年最值得补的课。