什么是提示词工程?一份实用指南
了解提示词工程的含义、为什么提示词会影响 AI 输出,以及如何为文本、图像和视频工作流写出更清楚的提示词。

TL;DR:提示词工程就是把 AI 指令说清楚
提示词工程,是指通过编写、组织、测试和修改指令,让 AI 系统产出更有用结果的一套实践。好的提示词通常包含任务、上下文、约束、输出格式、必要示例,以及判断结果是否合格的方法。
这个词听起来可能比实际更技术化。在日常工作里,提示词工程就是把“帮我优化一下”这样的模糊请求,改写成模型真正能执行的清楚指令。
这篇指南基于 VideoBreakdown 的视频提示词工作流,并参考了 OpenAI、Anthropic、Google、Microsoft 和 Runway 的公开文档。文末的来源列表说明了各部分内容参考了哪些资料。
对视频创作者来说,提示词工程还包括时间维度的指令:场景顺序、镜头运动、主体运动、光线、音频线索、节奏、画面比例,以及最终画面应该是什么样。把视频参考转换成可复用 AI 视频提示词时,VideoBreakdown 这类结构化工作流会很有帮助。
什么是提示词工程?
提示词工程是一套与 AI 模型沟通的实用方法。与其期待模型自己猜中你的意图,不如把它完成任务所需要的信息明确给出来。
提示词可以是一句话、一份长 brief、一张表格、一个 JSON 结构、一组镜头清单,或者一组示例。格式本身不是重点,重点是它能否完成沟通任务。一个有用的提示词会告诉 AI:
- 要完成什么任务
- 应该使用哪些上下文
- 需要遵守哪些约束
- 应该返回什么输出格式
- 好结果和坏结果分别是什么样
- 遇到不确定信息时该怎么处理
提示词工程不是神奇咒语。它更像是在写清楚的创意 brief、客服工单、产品需求或制作说明。指令越明确,结果就越容易测试,也越容易改进。
为什么提示词工程重要
AI 模型很灵活,但这种灵活性也会带来泛泛而谈的答案。如果提示词没有说明受众、目标、源材料、格式或约束,模型就只能猜。有时猜得不错,但更多时候会变得很通用。
提示词工程的价值在于把工作讲明白。更好的提示词可以:
- 减少泛化输出
- 让答案更贴近目标
- 让结果更容易比较
- 帮助团队复用同一套工作流
- 给你一个更清楚的方式去修改差结果
- 降低隐私、版权或格式错误的概率
它不能保证完美答案。模型限制、源材料质量、安全规则、随机性和缺失上下文仍然会影响结果。但清楚的提示词能给你更好的起点,也给你更好的调试方式。
好提示词的主要组成部分
大多数实用提示词都由类似的模块组成。你不需要每次都用上所有模块,但知道这些模块,会让你更容易改进薄弱提示词。
| 提示词组成 | 作用 | 示例 |
|---|---|---|
| 任务 | 说明要做什么 | 写一段 20 秒视频提示词 |
| 上下文 | 解释使用场景 | 这段视频用于护肤品演示 |
| 约束 | 设定边界 | 保持竖屏、写实,并注意隐私安全 |
| 输出格式 | 让结果可直接使用 | 返回场景、镜头、运动、音频和负面提示词 |
| 评估标准 | 定义成功结果 | 结果要具体到可以放进 AI 视频工具里测试 |
任务
先说清楚任务。“帮我看看这个”很弱,因为它没有说明“帮忙”到底是什么意思。“把这个产品演示想法改写成一段 20 秒竖屏视频提示词”就给了模型更明确的目标。
好的任务指令通常会使用总结、分类、提取、比较、改写、生成、规划、转换、批评等动词。
上下文
上下文告诉模型它正在什么场景里工作。写作任务可能包括受众、语气、目标、源材料和品牌表达;视频任务可能包括主体、场景、平台、参考片段、镜头类型、光线和节奏。
没有上下文时,模型会自行补空白。用于头脑风暴时这可能有用,但当你需要可控结果时就有风险。
约束
约束定义输出应该做什么,以及不应该做什么。它可以覆盖长度、结构、语气、阅读难度、隐私、声明、权利敏感细节、画面比例、时长或模型限制。
对视频提示词来说,约束经常包括负面提示词,例如避免闪烁、手部扭曲、随机跳切、文字不可读、面部漂移或光线不一致。
输出格式
提示词工程不只是为了得到一个“好答案”,也是为了得到一个能直接使用的答案。明确输出格式可以节省大量整理时间。
你可以要求返回:
- 项目符号列表
- 表格
- JSON 对象
- 脚本
- 逐镜头计划
- 包含场景、镜头、运动、光线、音频和约束的提示词包
如果结果会交给另一个工具或团队成员使用,格式就很重要。
示例和参考
示例能帮助模型理解你想要的模式。样例输出、参考视频、风格说明,或修改前后的提示词,都可以引导模型。
使用参考时要负责任。如果你基于不属于自己的视频工作,不要要求模型盲目复制受保护的创意元素。更应该关注结构、镜头语言、节奏,以及你有权使用的可观察细节。
评估循环
提示词工程包括测试。模型回答后,把输出和你的目标对比。如果答案太宽泛,就补上下文;如果格式不对,就把格式要求写得更明确;如果视频提示词像静态图,就加入运动、镜头顺序和时间安排。
一次只修改一层,这样你才知道变化来自哪里。
提示词工程示例
理解提示词工程最简单的方法,是对比一个模糊提示词和一个结构化提示词。
文本提示词示例
模糊提示词:
总结这篇文章。
更工程化的提示词:
请为一位忙碌的创始人总结这篇文章。返回五个要点:主要观点、支撑证据、商业风险、机会,以及一个建议的下一步行动。不要添加文章里没有的信息。
第二个提示词给出了任务、受众、格式和事实边界。
图像提示词示例
模糊提示词:
生成一张产品图。
更工程化的提示词:
生成一张正方形产品图:一个哑光黑色水杯放在浅色石材台面上。使用柔和晨间窗光、干净的生活方式摄影风格、浅景深和安静高级的氛围。保持背景不杂乱,并避免不可读的 Logo 文字。
第二个提示词给出了主体、场景、光线、风格、构图、情绪和约束。
视频提示词示例
模糊提示词:
给耳机做一个很酷的广告。
更工程化的提示词:
生成一段 12 秒竖屏产品演示视频:一位创作者在干净桌面前介绍无线耳机。先以耳机特写开场,切到创作者把耳机拿向镜头,最后停在稳定的产品主画面。使用柔和棚拍光、真实手部动作、冷静的科技测评节奏、轻微房间氛围声和干净背景。避免手部变形、闪烁、Logo 文字不可读和随机跳切。
第二个提示词给出了主体、时长、画面比例、场景顺序、镜头构图、运动、光线、音频、节奏、最终帧和负面约束。
如何写出更好的 AI 提示词
不知道从哪里开始时,可以用这个简单流程:
- 先写任务。明确你要的输出是总结、表格、脚本、提示词、计划、比较,还是批评。
- 加入有用上下文。包括受众、目标、源材料、场景笔记、品牌方向、平台或工作流细节。
- 设定边界。明确长度、语气、风格、事实要求、隐私限制、输出格式和需要避开的细节。
- 测试并修改。把结果和目标对比,一次只改提示词的一部分。
下面是一个可复用结构:
你的任务是 [具体任务]。
使用这些上下文:[受众、目标、源材料或场景细节]。
遵守这些约束:[长度、风格、事实、隐私、权利或格式限制]。
请以 [格式] 返回结果。
结束前检查:[成功标准]。
简单任务可以保持简短;高风险、创意型或生产级任务则可以展开更多细节。
视频提示词工程有什么不同
文本提示词往往描述一个静态答案,而视频提示词需要时间。强 AI 视频提示词应该说明从第一秒到最后一帧发生了什么变化。
因此,视频提示词工程通常需要包含:
- 主体和动作
- 场景环境
- 镜头顺序
- 镜头角度和镜头运动
- 主体运动
- 光线和色彩
- 视觉风格
- 时长和画面比例
- 有用时加入音频线索
- 节奏和转场
- 负面提示词细节
- 最终帧控制
如果你已经有参考视频,先把它拆成可观察细节。不要猜测隐藏的模型参数、seed、私有提示词或创作者工作流。把你能看见、听见的内容翻译成清楚的提示词语言。
想看逐步流程,可以阅读 如何从视频生成提示词。如果你已有粗糙提示词,想加强镜头、运动、风格和音频细节,可以使用 视频提示词优化器。如果你想先看案例,可以浏览 AI 视频提示词库。
常见提示词工程错误
不要只依赖风格词。“电影感”“爆款”“专业”“高质量”这些词有时有帮助,但单独使用远远不够。
不要隐藏真正目标。如果你需要的是产品演示提示词,就直接说。如果输出必须适合公开落地页,也要说清楚。
不要等模型回答后才补输出格式。把格式要求写进最初的提示词里。
不要把第一次输出当成最终结果。好的提示通常是一个循环:提示、结果、对比、修改。
除非你理解隐私条款并且有权使用材料,否则不要把私人或权利敏感的源材料上传到工具里。
延伸阅读和来源
这篇指南把以下公开资料作为背景参考。如果你想更深入了解提示词设计、不同模型的提示技巧、评估方式和 AI 视频提示词,它们很值得阅读。
- OpenAI Prompt Engineering guide:用于提示词工程定义,以及“提示需要测试,因为模型输出并不完全确定”的提醒。
- OpenAI Prompting guide:用于说明输出质量往往取决于提示是否清楚。
- Anthropic Prompt engineering overview:用于“有用的提示工作从成功标准、评估方法和可改进初稿开始”的思路。
- Anthropic Prompting best practices:作为关于清晰度、示例、结构和模型特定提示方法的模型厂商参考。
- Google Cloud Prompt Engineering for AI guide:用于提示词工程作为“结合上下文、指令和示例来设计并优化提示”的广义定义。
- Google Cloud introduction to prompting:用于说明提示可以包含问题、指令、上下文信息、示例和部分输入。
- Microsoft Foundry prompt engineering techniques:用于少样本示例、清晰语法和验证生成结果等实用提示模式。
- OpenAI Sora 2 Prompting Guide:作为视频提示词结构的归档背景资料,包括分镜式结构、镜头构图、动作节拍、光线和镜头组织。不要把它当作当前 API 指南。
- Google DeepMind Veo prompt guide:用于视频提示词元素,例如镜头构图、运动、视觉风格、光线、角色细节、地点和声音设计。
- Runway Gen-4 Video Prompting Guide:用于“从简单提示开始、清楚描述运动,并逐层加入提示元素迭代”的建议。
什么时候使用提示词工具
手动提示词工程给你最大的控制权。它适合敏感、非常具体或法律关系复杂的任务。
结构化工具适合需要快速初稿、一致字段或可复用工作流的场景。对视频提示词来说,VideoBreakdown 可以把参考视频整理成提示词所需的组成部分,例如场景、镜头、运动、光线、音频和约束。
可以用这个判断框架:
- 源材料私密、敏感或仍在构思时,使用手动提示。
- 想把参考视频转换成结构化提示词包时,使用 VideoBreakdown。
- 起点是公开视频链接时,使用 链接转提示词生成器。
- 参考视频来自 YouTube 时,使用 YouTube 视频转提示词生成器。
- 只需要一个聚焦场景时,使用 场景提示词生成器。
- 已有粗糙提示词、想进一步打磨时,使用 视频提示词优化器。
FAQ
用简单的话说,什么是提示词工程?
提示词工程就是编写并修改指令,让 AI 模型获得更清楚的任务、上下文和输出格式。
为什么提示词工程很重要?
它能减少模糊输出,让结果更容易比较,并给你一套可重复的方法来改进 AI 工作流。
学提示词工程需要会编程吗?
不需要。编程有助于自动化或 API 工作流,但很多有用的提示词都可以用自然语言写出来。
好提示词应该包含什么?
好的提示词通常包含任务、上下文、约束、输出格式、必要示例,以及检查结果的方法。
提示词工程只适用于 ChatGPT 吗?
不是。同样的思路适用于文本、图像、视频、音频、搜索、编程和自动化模型。
视频提示词工程有什么不同?
视频提示词需要时间维度,比如场景顺序、运动、镜头运动、节奏、音频线索和最终帧。
提示词工程能保证 AI 输出完美吗?
不能。它能提升控制感和可重复性,但模型限制、源材料质量、安全规则和随机性仍然会影响结果。
提示词工程可以安全用于商业工作吗?
可以,但提示词只是工作流的一部分。你仍然需要对源材料、私人数据、人物、品牌、音乐、声明和最终生成结果负责。
如何练习提示词工程?
从一个任务开始,先写一个简单提示词,测试它,把输出和目标对比,然后一次修改提示词的一部分。
总结
提示词工程是一种习惯:把指令写到足够清楚,以至于可以测试。定义任务、加入上下文、设定约束、选择输出格式、对比结果,并有意识地修改。
对 AI 视频来说,同一件事会变得更具体:描述场景、镜头、运动、光线、音频、时间安排和最终帧。当你想更快起步时,可以用 VideoBreakdown 把参考视频转换成结构化提示词,再根据你的模型、权利要求和创意目标调整最终措辞。