Figwise
返回博客
Gemini 图文摘要提示词:2 个直接复制就能用

Gemini 图文摘要提示词:2 个直接复制就能用

把整段摘要丢给 AI,换回来的只是一张塞满字、还全是生造词的图。换个写法——把提示词分成四层,同时搞清楚生成的图到底能用在哪。

FigwiseFigwise 团队

几乎所有人写的提示词都是同一句:“根据这段摘要生成一张图文摘要”,后面直接粘一整段摘要。图回来了,画面挤得满满当当,小段落密密麻麻没人看得清,上面的“单词”还根本不是单词。

问题在于,这条提示词是让模型给一份摘要再做一次摘要,同时把所有视觉决策都留成了空白——空白,模型自然会替你填。

真正能用的提示词分四层,顺序不能乱:这张图必须证明的那一句话、版式与阅读方向、精确到字的文字内容和配色限制,最后是锁定语言。下文两个示例提示词都是照这个结构写的。直接粘进 Gemini App 或 AI Studio(Google 的 Nano Banana Pro 图像模型 就跑在这里),把研究内容换成你自己的即可。

不过在动手之前,先说清楚这张图能拿来干什么。

生成的是草稿,不是你的投稿文件

两家最大的出版社都白纸黑字地说了“不行”,这话得放在最前面。

爱思唯尔的期刊生成式 AI 政策专门给图文摘要留了一节:

"General-purpose generative AI image tools must not be used to create graphical abstracts."(不得使用通用生成式 AI 图像工具制作图文摘要。)

爱思唯尔生成式 AI 政策页面第三节,关于图文摘要与封面图,写明不得使用通用生成式 AI 图像工具制作图文摘要

爱思唯尔针对图文摘要与封面图的规定。来源:elsevier.com,截图于 2026 年 8 月 25 日。

施普林格·自然的指南覆盖面更广,话也更直白:"Avoid generative AI images or figures. These are not permitted for publication unless they meet specific exceptions (legally sourced, directly about AI, or based on verifiable scientific data) and are clearly labelled as 'AI-generated.'"(避免使用生成式 AI 生成的图像或插图。除非满足特定例外情形——来源合法、内容本身就是关于 AI、或基于可核验的科学数据——并明确标注为“AI 生成”,否则不允许用于发表。)

所以一条提示词换来的是一份草稿。拿它来验证你的核心结论能不能装进一张图,拿它给合作者看一个可以当场推翻的雏形,或者做张幻灯片。真正要投出去的文件,还得回到绘图软件里重做。关于六家出版社实际允许到什么程度,以及工具选择如何决定后面所有工作,我们另外写了两篇。

为什么直接粘摘要注定失败

你的摘要是写给逐字阅读的人看的。而一张图,读者只花几秒。

一段摘要里塞着十几条发现、三处方法细节、两条局限性。你把这一整坨交给模型,它就会试着全画出来——因为提示词里没有任何一句告诉它该舍掉什么。于是本来四个分栏够用的图变成了八个,长句子被印成没人能看清的字号。

第二种失败出在文字上。图像模型画的是字母的形状,不是单词,除非提示词明确写出该出现哪些字。Google 自己的提示词指南把这一条放在 "Specific text integration"(具体的文字植入)下面:"Clearly state what text should appear and how it should look."(明确说明应该出现什么文字、看起来是什么样。)你不说,模型就会用你所在领域的词汇,编出一堆看着像那么回事的标签。

Google 针对 Nano Banana Pro 的提示词技巧,列出构图与画幅比例、镜头与光线、具体的文字植入、示意图的事实性约束、参考图输入等要点

Google 的进阶提示词要素,其中包括文字规则和示意图的事实性约束。来源:blog.google,截图于 2026 年 8 月 25 日。

这不是说摘要在提示词里就没位置了。把它放在四层之后作为背景信息,并加一句说明:这段只是上下文,分栏内容以你指定的版式为准。

一条好提示词的四层结构

按顺序往下写。每一层都堵死一个原本会由模型替你填的空。

第一层:这张图必须证明的那一句话

在写任何视觉描述之前,先用一句大白话把结论说出来。

不是选题,是结论。“我们研究了肥胖小鼠的限时进食”是选题,模型拿它画不出任何东西;“八周限时进食在总热量摄入不变的前提下降低了肝脏脂肪”才是结论,之后每一个分栏都能拿它来检验。

这也是检验你这张图最省事的办法。如果这句话你写不出来,那问题就不在提示词上。

第二层:版式与阅读方向

说清楚几个分栏、排成什么形状、视线怎么走。

模型默认会给你一张乱糟糟的拼贴。你得指定排布方式:从左到右的一整行、从上到下的一列,或者一个中心加若干分支。然后按阅读顺序,一行字描述一个分栏。Google 的指南把这一步叫 "Define the canvas"(定义画布),它针对示意图另有一条规则是 "specify the need for accuracy"(明确提出准确性要求)——而指定结构,正是让准确性变得可核查的办法。

写这一层之前,先确定目标期刊要什么形状,别等写完再说。每家出版社的画幅要求都不一样,各期刊图文摘要规范页面做了汇总。期刊要横幅,你的提示词却生成了竖版,那是重做,不是裁一刀的事。

第三层:精确到字的文字内容和配色限制

把你想出现在图里的每一个词都列出来、按你要的写法拼好,其余一律禁止。

一个短标题,每个分栏一个标签,再无其他。标签要在提示词里用引号原样写出来。然后补上否定的那一半——多数提示词模板都会漏掉这半边:不要段落、不要坐标轴数字、不要生造词。有没有这一句,区别就是“四个能看清的标签”和“四个标签外加十四坨装饰性乱码”。

配色也归在这一层,而且要写成限制而不是愿望。指定两三种颜色加一种点缀色。“低饱和的蓝灰配一个橙色点缀”能落地;“专业的配色方案”不能。

第四层:锁定语言

加一句,指明图中所有文字用什么语言。

这一层几乎没人写,而它导致的故障最离奇。提示词里不固定语言,模型就会从研究的地域背景或摘要里的人名去猜,于是一篇写中国队列的英文摘要,回来的图上可能混着两种文字。喂给它一篇非英文摘要,它可能翻译一半标签、另一半原样留着。我们自己的图文摘要生成器在内置提示词里带着这条指令,原因正在于此:除非摘要本身明显是另一种语言,否则一律用英文书写,且绝不使用摘要里没有出现过的语言。

一句话就够:"Write every word in the image in English. Use no other language and no invented characters."(图中所有文字一律使用英文,不得使用其他语言,不得出现生造字符。)

提示词 1:实验类论文

完整版在下面。粘过去,把研究内容换成你自己的,四层结构保持不变。

A scientific graphical abstract for a journal article. Flat vector illustration,
clean white background, muted palette of blues and grays with one orange accent,
wide banner layout.

The one thing this figure must prove: in mice with diet-induced obesity, eight
weeks of time-restricted feeding lowered liver fat without changing total
calories eaten.

Layout: four panels in a single row, read left to right, joined by thin arrows.
Panel 1 - two matched groups of mice, one beside a clock marking a limited
feeding window, one beside food available all day.
Panel 2 - a feeding schedule bar for each group, both bars the same total length.
Panel 3 - two liver icons side by side, the time-restricted one with visibly
fewer fat droplets.
Panel 4 - a simple two-bar chart, the time-restricted bar clearly lower.

Text: render only the following words, spelled exactly as written.
Title across the top: "Time-restricted feeding cuts liver fat at equal calories"
One label under each panel, in order: "Two matched groups", "Same daily intake",
"Less liver fat", "Measured in both groups"
Use a clean sans-serif font. Put no other text anywhere in the image. No
paragraphs, no numbers on the axes, no invented words, no characters that are
not real English letters.

Style limits: no photorealism, no 3D rendering, no drop shadows, no gradients,
no decorative background. Scientifically accurate shapes only. Leave generous
white space between panels.

对照四层再读一遍。第一段是风格和画布。第二段是结论,也是唯一一段你必须从头重写的内容。

第三段是版式和阅读顺序。第四段是文字锁定,写得最长是故意的。第五段用来干掉模型的默认偏好——它天生就爱往亮面 3D 和厚重投影上跑。

提示词 2:综述类论文

综述没有单一实验,所以第一层要换个形态:结论说的是这个领域的现状,而不是某一个结果。

A scientific graphical abstract for a review article. Flat vector illustration,
clean white background, muted palette of teals and grays with one amber accent,
wide banner layout.

The one thing this figure must prove: research on microplastics in freshwater
fish has grown quickly, but the three methods used to count particles disagree,
so results across studies cannot be pooled.

Layout: read top to bottom, with three parallel branches in the middle.
Top - a stack of journal papers with a rising trend line beside it, standing for
the growing literature.
Middle - three branches leaving the stack, one per detection method: sorting by
eye under a microscope, staining with a fluorescent dye, and spectroscopy.
Bottom - the three branches arrive at three separated dots on one axis, spaced
far apart so they clearly do not agree.
Right edge - one open box holding a question mark, set apart from the rest.

Text: render only the following words, spelled exactly as written.
Title across the top: "Three counting methods, three different answers"
One label per branch, in order: "Visual sorting", "Fluorescent staining",
"Spectroscopy"
Three section labels: "Growing literature", "Results do not agree",
"Open question: one shared protocol"
Use a clean sans-serif font. Put no other text anywhere in the image. No
paragraphs, no numbers on the axis, no invented words, no characters that are
not real English letters.

Style limits: no photorealism, no 3D rendering, no drop shadows, no gradients,
no decorative background. Keep generous white space between the branches.

这两条提示词都是把四层结构套在一个虚构研究上写出来的,所以请把它们当成待填充的骨架,而不是经过验证的灵丹妙药。综述具体该用哪种形状,取决于综述的类型,综述类论文的图文摘要怎么做一文讲了这一点。

先让 AI 出方案,再让它出图

如果卡住你的正是版式那一层,那就把活儿拆成两步。

先把摘要发给文本模型,让它给一份分栏方案:几个分栏、每个分栏画什么、标签写什么。看完方案、改好,再把它填进图像提示词的第二层。你改一份清单很快,改一张图很慢,所以要让模型在“改起来便宜”的环节跟你争。

这一步还能保护你的结论。写成文字的方案能让你看出第三栏其实是把对照组当成了发现来呈现——而这种问题,等图出来了根本看不出来。

第二轮怎么改

一轮只改一件事,而且要说“改哪里”,不要把整条提示词重贴一遍。

Google 的指南在修图这件事上说得很干脆:"For modifying an existing image, be direct and specific."(修改已有图像时,要直接、具体。)最常遇到的三种问题:

  • 某个标签出错或糊成一团。 把那串字用引号原样重写一遍,并说明它该放在哪。别去改写标签措辞,否则你会拿到第三种拼法。
  • 画面塞得太满。 从版式那一层删掉一个分栏,而不是要求“少一点杂乱”。模型没法计算“杂乱”,但它能砍掉一个分栏。
  • 颜色跑偏了。 把配色作为限制重申一遍,并点名要去掉什么:那个渐变、那道投影、那第二种点缀色。

如果改了三轮还不对,毛病通常出在第一层。一个需要两句话才能说清的结论,本来就该配两张图。

专用工具适合什么场景

只做图文摘要的工具会替你把这四层写好——省掉了写提示词的工夫,也顺带省掉了你能做的选择。

我们的图文摘要生成器接收摘要,套用一版固定的四层结构:分栏数量、阅读方向、标签长度、配色和语言都是预先定死的。它输出的是一张扁平 PNG,标签不可编辑,因此正好落在上文那条爱思唯尔规定的这一侧。它是一份你可以据此做判断的草稿,不是投稿文件。

使用需要账号,每次生成消耗 30 个积分。新账号自带 85 个积分,所以在付费之前你能免费跑两次。

版式比较特殊、结论需要一种模板给不了的形状、或者你想围绕某一个分栏反复打磨时,自己写提示词更合适。想在一分钟内看到点东西、据此判断这张图值不值得花一个下午,那就用工具。

作者常问的问题

最短能用的提示词是什么样?

结论一句、分栏数量加阅读方向、用引号写死的标签、外加一句禁止多余文字。大约四句话。风格和配色可以不写,文字锁定不能省——大部分失败都是从那里开始的。

在 ChatGPT、Gemini 和其他图像模型上同样适用吗?

四层结构是通用的,因为它堵的是所有图像模型都有的那些空子。各模型之间会变的是风格层的措辞,而文字渲染质量的差异最大。测试时用一个你自己已经知道该怎么画的结论,这样你才分得清是模型的问题还是提示词的问题。

AI 生成的图文摘要能用在会议海报或报告里吗?

一般可以,而且这正是这类提示词最能派上用场的地方。上文引用的出版社规定,管的是随稿件一起提交的插图。海报和幻灯片的使用受你所参加会议自身规则的约束,所以要去查一下,并注明图是用什么工具生成的。

动手之前

按顺序把四层写完,并且无论如何都把结果当草稿——它只是一种快速验证方式,看你那一句话被画出来之后还立不立得住。要投出去的版本,终究得在别处重做一遍。如果你还没想好自己这张图要证明什么,那就先从图文摘要到底要做什么看起。