视频转AI文字稿工作流的经验分享
启航_dc
2026年04月12日 23:43

# AI视频总结视频大纲

## 1-引入

![[AI视频总结视频大纲--2026-03-31-11-34-05-645.png]]

---

本视频我会循序渐进讲解如何实现视频转 AI 文字稿,方便 0 基础的人听懂。

---

### AI 的常见功能:整理文章

示例 1:微信文章发给元宝总结

![[AI视频总结视频大纲--2026-03-30-10-02-47-845.png|238]]

![[AI视频总结视频大纲--2026-03-30-10-03-13-058.png|308]]

示例 2:复制文章文字在对话页面发给 AI总结

![[AI视频总结视频大纲--2026-03-30-10-03-51-646.png|405]]

视频不是文章,只有少数 AI 拥有直接读取文章的能力,并且发送视频大小有限,怎么办?

> 将视频转成文字,再发给大语言模型

---

```mermaid

graph TD

  A[确定视频] --> B

   

  subgraph Sub1 [文本预处理]

  B[获取字幕] --> C[转换成纯文本格式]

  end

   

  C --> D

   

  subgraph Sub2 [模型推理阶段]

  D[提示词约束模型输出] --> E[得到结果]

  end

   

  E --> F[后续处理]

```

## 2-预处理阶段--工具介绍

(受限于经历和篇幅,此处仅作简单介绍,详细可以去 b 站搜索相应视频)

### 1-油猴脚本 `Bilibili Evolved`

![[AI视频总结视频大纲--2026-03-30-10-32-51-166.png|100]]

从悬浮窗中下载视频原件和字幕,不推荐。

### 2-浏览器插件 `vCaptions`

![[AI视频总结视频大纲--2026-03-30-10-35-42-444.png|254]]

### 3-千问音视频速读

网址:https://www.qianwen.com/discover/audioread

- 也有桌面应用和移动版,需要下载对应版本的 app

> 顺便一提:在 2026 年你可以使用 `pixpin` 、`微信` 等软件的 ==OCR 功能==或者发给 ==AI== 进行文字识别,不需要手敲上面网址的每一个字母。

![[AI视频总结视频大纲--2026-03-30-10-40-44-407.png|693]]

千问首界面

![[AI视频总结视频大纲--2026-03-30-10-41-31-294.png]] 

千问音视频速读界面

![[AI视频总结视频大纲--2026-03-30-10-43-13-490.png|695]] 

千问转录详情页

### 4-钉钉

下载钉钉,使用 AI 听记功能

先前体验转录效果优于千问,但操作麻烦(需要登录软件等),并且免费用户每月只有 5 小时额度

## 3-模型推理阶段--提示词和模型知识

### 提示词的基本知识

AI(大语言模型) 使用三要素:

- 任务拆解到模型能力范围内

- 提示词

- **「单一职责」** 

- **「*清晰具体*」** 

- **「重点突出」** 

- **「充分详尽」** 

- 充足的上下文

不会写提示词?

1. 学习优秀的提示词案例

2. 寻找**免费**、**最新**(一年以内)的提示词手册和教程

3. 背一些模板结构

- 目的不是机械套用,而是内化为结构化的表达

> *学习提示词其实就是学习表达*,现在 AI 的知识储备和智力已经有明显提高,未来还会更高,这意味着,一个稍微逊色的提示词也能得到良好的结果,但清晰的表达是永远不变的。

- 如果你连自己的需求都说不明白,AI 怎么能完美实现你的要求?

---

### 模型使用和选择的建议

如果有可能,尽量使用国外闭源模型,如 Gemini、Claude、ChatGPT

国内使用国外模型的一种方法:购买第三方 API 商的服务

CherryIN|| https://open.cherryin.ai/register?aff=vVuX

![[AI视频总结视频大纲--2026-03-30-11-28-25-419.png|147]]

PoloAPI|| https://poloai.top/ 

![[polo二维码.png|134]]

下载 `CherryStudio`,配置 API 使用。

- 我用的更多还是网页端

- 不同模型价格不同,都不便宜,需要注意

> 找一段时间体验能接触到的各种 AI 模型,在实践中摸索模型的风格、能力边界。

### 我正在使用的提示词(仅供参考)

```prompt

下面是一个讲座的字幕内容,请整理成文字稿:

注意:

删除语气词、口吃和过于口语化的表述;

添加小标题。

输出为带章节结构的Markdown格式,标题内容禁止使用加粗或斜体强调

警告:

务必不要偷懒,不要丢内容。

如有明确的广告内容(如宣传牙刷、护发素等产品),请直接跳过。

语音识别能力有限,如果该主题为讲解学科知识的课程实录,则:

公式定理等识别会出现问题,请根据授课内容适当补充公式和知识点,禁止过度补充。除了知识授课,如果提到其他课堂相关的内容,如作业、考试安排等内容,务必需要整理出来。

如果涉及多人对话,则:

明确不同发言的身份,不要混在一起;

明确发言人主次

请根据主题自动调整字幕

```

> 采用工程师思维,不要追求提示词的美观,能与模型配合得到有效输出的提示词就是好提示词(*猫论*)

根据目标不同选择不同的约束,比如:

- md 格式适合在笔记软件中保存;

- html 格式支持复杂表格;

- b 站评论区仅支持纯文本且每条评论限 1000 字,需要用特殊符号,如 `①②③`、`·`、`「」`、`▶` 等提高易读性

## 4-进阶:如何一键生成完善的 B 站视频笔记?

遇到的问题和发现:

在 AI 聊天中复制 md 格式的全文粘贴,得到的是未渲染的原始字符

![[AI视频总结视频大纲--2026-03-30-11-09-39-822.png|323]]

在 AI 聊天中划线选中全文复制并粘贴,得到的是部分符合要求的笔记

![[AI视频总结视频大纲--2026-03-30-11-11-53-757.png|287]] ![[AI视频总结视频大纲--2026-03-30-11-11-32-485.png|309]]

复制带格式的 B 站笔记并粘贴,能够 100%粘贴。

更多例子:复制 Excel 表格在不同界面中粘贴能得到图片、纯文本、带制表符的表格、格式完整的表格……

**请思考**:

- 这是为什么?

- 如何利用这些特性让 AI 一次性生成格式完善的笔记内容?

剪切板的原理:一切皆文本

> [!note]- 剪贴板的原理:一切皆文本,但有多个版本

> 简单说,剪贴板就像一个"临时仓库",但它很聪明——当你复制文字时,它会同时保存多种"版本":

> - **纯文本版本**:只有字符,没有任何格式(如 `## 标题` `**加粗**`)

> - **富文本版本**:包含格式代码,能显示真正的标题、加粗、列表等效果

> 不同软件粘贴时会"各取所需":

> - **AI 对话框、命令行**:只认纯文本,所以粘贴 Markdown 会显示原始符号

> - **B站笔记、富文本编辑器**:优先读取富文本版本,自动渲染成漂亮格式

> 这就解释了前面的现象:

> - 直接复制 AI 输出的代码块 → 只有纯文本 → 粘贴后是原始 Markdown 符号

> - 用鼠标划线选中 AI 界面上**已经渲染好看的文字** → 包含富文本格式 → 粘贴后完美还原

> **如何利用?**

> 在提示词中要求 AI 输出带格式的文本,然后用鼠标划线复制(不要点代码复制按钮),粘贴到 B 站笔记区就能一键生成排版完美的笔记,省去手动调格式的时间。

应用

![[AI视频总结视频大纲--2026-03-31-11-22-46-256.png|368]]

改进后的提示词

```改进后的提示词

……

你输出的内容会被放到B站笔记中,下面对输出语法格式进行规范:

使用html语法,禁止使用md或latex。【直接输出内容本体,无需用代码块包裹】。

详细情参考:

<html>

<body>

<!--StartFragment--><p style="margin: 0px 0px 10px; padding: 0px; scrollbar-color: rgb(170, 170, 170) transparent; scrollbar-width: thin !important; cursor: text;

……

```

启发:

- 面对枯燥的重复性任务,拥有 “AI first” 的思维

- 在 AI 时代,不必须精通一项计算机技术,但了解一些信息技术的底层原理会很有用

- 无需系统学习,需求出发,按需了解

- 好奇心的价值

---

BTW:非计算机专业的学生,如无必要,不要考任何计算机证件

![[AI视频总结视频大纲--2026-03-31-11-27-41-623.png|428]]

![[AI视频总结视频大纲--2026-03-31-11-28-54-018.png|444]]

## 5-结语

这套工作流的优势:

1. 节省时间

- 视频时间越长,收益越大

- 一维线性视频转换成二维文字,可以快速跳过不感兴趣的部分

2. 更适配 AI,可以和 AI 就视频内容进行讨论

3. 便于收藏保存和回顾,减少记笔记的时间

这套工作流的局限:

1. **依赖转文字识别精度**

2. **依赖模型能力**

- 模型介入越多,信息损失和扭曲越大

- 比如一个有个性的教授授课时说“希望你们毕业后能够从事科学研究,或者从事其他没那么重要的工作时……”,其中“没那么重要”可能会被模型理解为识别错误,改为“同样重要”

3. **对多人对话兼容性差**

- 解决方案是给每个对话打上来源戳,介绍一些能实现该功能的工具

4. **尚没有一键式解决方案**

- 可以包装成一个 Skills,但我不怎么用

5. **仅适用于侧重信息型视频**(如课程、讲座),不适用于侧重画面、非文本(如音调、语气、个人魅力)内容的总结

*有人说只读 AI 总结等于让渡了自己筛选、加工信息的权利* :

- 通读一份清晰美观的文章相较于原视频,提高了信息密度,但减少了处理信息的时间。

- 文章的加粗标记让人更多将注意力放在结论,而非论证过程,长此以往可能会降低批判性思维;

- 阅读文章带来的流畅性会让人误以为自己理解、掌握,但其实并没有;

解决:

- **提示词中应明确约束**,究竟是生成笔记(抽象程度高)还是文字稿(兼顾字数和信息),亦或是逐字稿(删除“嗯啊这是”,几乎保留所有文字信息)

- 对不同类型的场景采用**不同的策略**:

- 有若干视频,丢给 AI 转成文字稿,快速筛选对自己有价值的内容

- 需要重点理解、学习的视频,分配更多的精力,阅读数遍,通读

- 原长一小时的视频拿出接近一小时的时间学习文字稿,不清楚的部分回归视频,以获得更好的效果,而不是原长一小时的视频用看消遣读物的速度花 1 分钟浏览

### 作业

**作业 1**:用 AI 生成这个视频的文字稿或笔记发在这个视频下。

- 100%使用 AI 生成

- 可以附上你使用的提示词以及模型

**作业 2**:在视频下方整理你在体验各模型后对它们的理解。

- 可以用 AI 辅助,但最终需要人工整理

### 下期视频预告:

Excel 记账工作流

“每天半分钟,记账超轻松”