Grok Imagine 使用教程:2026 新手图文实战

Grok Imagine 是 xAI 藏在 grok.com 里的图像与视频生成器:一条提示词约十秒返回十六个变体,改图靠一句话指令,能渲染海报级文字,还能把任何一帧变成带生成音效的短视频。本教程跟着一次真实会话走完全流程——批量出图、指令改图、文字渲染、先图后视频的工作流、自有图片上传,以及复用探索页任何一段视频的混剪技巧。全部截图来自这次实测会话,每一步都链接回源视频的精确时间点。

来源与致谢

本教程的截图来自 TheAIGRID 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。

TheAIGRID ↗

入口:grock.com/imagine

  1. 1

    从 Grok 侧边栏进入 Imagine

    Grok Imagine 的入口是 grok.com/imagine,也可以从 Grok 侧边栏直接进。落地页是一整面社区作品墙——先刷一遍找风格感觉,然后点底部提示词框开始自己的创作。

    Grok Imagine 探索页,动漫、人像与电影感图片瀑布流铺满画面,底部是提示词输入框
    探索墙就是第一条提示词的风格素材库。视频 0:22 处
  2. 2

    先刷墙,再动笔

    滚一遍探索网格校准审美:时尚大片、动漫、产品摄影都在这里。探索墙不支持关键词搜索(搜索功能在 X 上),把它当情绪板用——看到喜欢的质感,用自己的话把这种质感描述出来。

    Grok Imagine 探索信息流,赛博朋克人像、动漫角色与时尚摄影作品混排供风格参考
    这里没有搜索,只能滚——把它当情绪板。视频 0:30 处
  3. 3

    用操作菜单借走任何一张图

    点开任意作品的操作菜单,可以下载图片、把它做成视频,或者跳回 Imagine 二次混剪。混剪社区作品是反推一条风格提示词怎么写的最快方式。

    Grok Imagine 作品卡上展开的操作菜单,提供下载、生成视频与混剪入口
    每张社区作品都能下载、做成视频或拿去混剪。视频 1:20 处

第一批图:一条提示词十六张

  1. 4

    第一条提示词:写具体就够

    教程里的示例是「McLaren 720S on a London street」——主体加场景,第一批图这就够了,光线和角度 Imagine 自己补。点 Go 之前先选好宽高比:横版 16:9、社交配图 1:1、竖版故事 9:16。

    提示词框内写着 McLaren 720S on a London street,下方是伦敦街景跑车成品网格
    「主体 + 场景」两段式,第一批图足够。视频 1:35 处
  2. 5

    看着批量结果流式加载

    结果是渐进到达的:前排图先清晰,后排还是模糊占位块,十六张全部就位大约十秒。Imagine 每次都出一整批而不是单张,所以你是在比较变体,而不是反复重摇一个格子。

    Grok Imagine 生成中的网格,上方跑车图已清晰、下方还是模糊占位块
    整批从上到下,十秒左右就位。视频 1:30 处
  3. 6

    在十六个变体里挑

    每一批都是同一条提示词的十六种诠释——角度不同、车漆不同、路过车辆不同。这种数量就是它的核心优势:ChatGPT 和 Gemini 一次给四个左右,Imagine 一次给十六个,往下滚还有更多。

    伦敦街景迈凯伦跑车的十六张成品批次,角度、配色与街景各不相同
    一条提示词十六种诠释——只挑,不重摇。视频 2:05 处
  4. 7

    搞清楚你的套餐额度

    这次实测跑在每月 $30 的 SuperGrok 上——重度批量出图并不是 $300 Heavy 档的专属。免费档同样能用 Imagine,只是额度更紧;项目做到一半撞墙,先等额度重置,别急着升级。

    SuperGrok 套餐页,Free、$30 SuperGrok 与 $300 SuperGrok Heavy 三档并列对比
    Imagine 没有被锁在 $300 的 Heavy 档后面。视频 1:50 处

用指令改图

  1. 8

    改图靠指令,不靠蒙版

    打开选中图,点 Edit image,清空输入框,直接打指令——「Change the car colour to yellow」。Imagine 是一台提示词编辑器:没有画笔、没有选区,说出想要的变化就行。

    橙色跑车图上的改图指令框,Change the car colour 指令正在输入中
    改图和出图一样,都是写指令。视频 3:20 处
  2. 9

    看结果,更要看「改动了什么」

    黄色改色约十秒落位。对比前后图时盯住边缘:指令式编辑通常会放过目标之外的一切,但复杂场景可能漂移——真漂了,原批次里那张没改过的往往比改过的更可用。

    改色后的黄色迈凯伦 720S 成品,左侧叠着改色前橙色车的缩略图
    同一条街换了车漆——查查周边有没有跟着变。视频 3:42 处

给社交平台做文字海报

  1. 10

    整张海报一起提示,文字写在引号里

    描述画面,把文案放进引号:「a viral AI news Instagram graphic in a bold and purple Art Deco metal style」加上标题原文。Imagine 会把文字直接渲染进批量结果——一条提示词,十六张可读海报。

    十六张紫色 Art Deco 风格海报批次,标题 AI agents are about to flood social media 以金属质感文字渲染在画面中
    文案放进引号,文字就会渲染进图里。视频 5:22 处
  2. 11

    带文字的批次要等更久

    带字的图约 20–25 秒,普通图只要 10–12 秒。换来的是准确率:短标题完整落地,长段落必崩——趁文字还干净,直接从详情视图把海报发出去。

    Art Deco 海报详情视图,标题 AI agents are about to flood social media 完整清晰可读
    短标题稳,长文案必糊。视频 5:00 处

从静图到带声音的视频

  1. 12

    在任意图片上打开视频菜单

    操作菜单里的 Make a video 会在动手前把设置摆给你:480p 省额度,6 秒片段渲染最快,宽高比默认跟随原图。声音默认开启——Grok Imagine 会随片段生成对白和环境音。

    生成汽车图片上展开的 Make a video 菜单,显示视频分辨率与宽高比选项
    480p 加 6 秒,是额度最友好的默认组合。视频 8:20 处
  2. 13

    先出定妆照,再让它动起来

    示例提示词「an old man complaining about taxes, he's wearing a red hat」先产出十六张静帧批次。先挑脸再动画,好过盲写视频提示词——图片批次就是你的选角现场。

    红帽老人角色的十六变体静帧批次,在转视频之前先批量选角
    图片批次是选角现场,动画只给中意的那张。视频 9:00 处

上传、混剪与放大

  1. 14

    上传前先关掉自动生成视频

    自己的照片拖进去,Imagine 会立刻开始把它变成视频——Auto-generate videos on upload 开关默认是开的。只想改静图就先关掉;不管关不关,上传的图几秒内就会变成六秒短片。

    上传照片正在 Grok Imagine 中转视频,画面里可见 upload 时自动生成视频的开关与 Cancel Video 按钮
    上传即触发,开关是默认打开的。视频 9:42 处
  2. 15

    从探索墙借一段视频来混剪

    在探索墙上看中一段视频,打开它的起始帧。构图留下,动作换掉——这就是混剪路径,顺便也是最生动的运镜提示词教学。

    探索墙上 selected 的武士刀战视频,停在起始帧准备混剪
    帧留下,动作随便你改。视频 10:48 处
  3. 16

    只改动作,不动画面

    示例拿武士对决的起始帧,提示「samurai pulls out a gun and starts firing」。结果保留了暴雨里的原野和服装,动作整个换掉——生成有随机性,通常重摇一次就能用。

    混剪后的 Grok Imagine 片段,武士在暴雨原野中拔枪射击,原构图完整保留
    同一场暴雨,同一身行头——动作全新。视频 10:52 处
  4. 17

    下载之前先放大

    打开片段菜单点 Upscale video,约十秒得到更清晰的母版。下载就是浏览器右键 Save video as。要上大屏幕的一律先放大;480p 原片留着当草稿足够。

    武士视频片段上的右键菜单,Upscale video 选项与删除、评分操作并列展示
    十秒,换一个更清晰的母版。视频 11:02 处

常见问题

继续探索