# AI视频总结视频大纲
## 1-引入
![[AI视频总结视频大纲--2026-03-31-11-34-05-645.png]]
---
本视频我会循序渐进讲解如何实现视频转 AI 文字稿,方便 0 基础的人听懂。
---
### AI 的常见功能:整理文章
示例 1:微信文章发给元宝总结
![[AI视频总结视频大纲--2026-03-30-10-02-47-845.png|238]]
![[AI视频总结视频大纲--2026-03-30-10-03-13-058.png|308]]
示例 2:复制文章文字在对话页面发给 AI总结
![[AI视频总结视频大纲--2026-03-30-10-03-51-646.png|405]]
视频不是文章,只有少数 AI 拥有直接读取文章的能力,并且发送视频大小有限,怎么办?
> 将视频转成文字,再发给大语言模型
---
```mermaid
graph TD
A[确定视频] --> B
subgraph Sub1 [文本预处理]
B[获取字幕] --> C[转换成纯文本格式]
end
C --> D
subgraph Sub2 [模型推理阶段]
D[提示词约束模型输出] --> E[得到结果]
end
E --> F[后续处理]
```
## 2-预处理阶段--工具介绍
(受限于经历和篇幅,此处仅作简单介绍,详细可以去 b 站搜索相应视频)
### 1-油猴脚本 `Bilibili Evolved`
![[AI视频总结视频大纲--2026-03-30-10-32-51-166.png|100]]
从悬浮窗中下载视频原件和字幕,不推荐。
### 2-浏览器插件 `vCaptions`
![[AI视频总结视频大纲--2026-03-30-10-35-42-444.png|254]]
### 3-千问音视频速读
网址:https://www.qianwen.com/discover/audioread
- 也有桌面应用和移动版,需要下载对应版本的 app
> 顺便一提:在 2026 年你可以使用 `pixpin` 、`微信` 等软件的 ==OCR 功能==或者发给 ==AI== 进行文字识别,不需要手敲上面网址的每一个字母。
![[AI视频总结视频大纲--2026-03-30-10-40-44-407.png|693]]
千问首界面
![[AI视频总结视频大纲--2026-03-30-10-41-31-294.png]]
千问音视频速读界面
![[AI视频总结视频大纲--2026-03-30-10-43-13-490.png|695]]
千问转录详情页
### 4-钉钉
下载钉钉,使用 AI 听记功能
先前体验转录效果优于千问,但操作麻烦(需要登录软件等),并且免费用户每月只有 5 小时额度
## 3-模型推理阶段--提示词和模型知识
### 提示词的基本知识
AI(大语言模型) 使用三要素:
- 任务拆解到模型能力范围内
- 提示词
- **「单一职责」**
- **「*清晰具体*」**
- **「重点突出」**
- **「充分详尽」**
- 充足的上下文
不会写提示词?
1. 学习优秀的提示词案例
2. 寻找**免费**、**最新**(一年以内)的提示词手册和教程
3. 背一些模板结构
- 目的不是机械套用,而是内化为结构化的表达
> *学习提示词其实就是学习表达*,现在 AI 的知识储备和智力已经有明显提高,未来还会更高,这意味着,一个稍微逊色的提示词也能得到良好的结果,但清晰的表达是永远不变的。
- 如果你连自己的需求都说不明白,AI 怎么能完美实现你的要求?
---
### 模型使用和选择的建议
如果有可能,尽量使用国外闭源模型,如 Gemini、Claude、ChatGPT
国内使用国外模型的一种方法:购买第三方 API 商的服务
CherryIN|| https://open.cherryin.ai/register?aff=vVuX
![[AI视频总结视频大纲--2026-03-30-11-28-25-419.png|147]]
PoloAPI|| https://poloai.top/
![[polo二维码.png|134]]
下载 `CherryStudio`,配置 API 使用。
- 我用的更多还是网页端
- 不同模型价格不同,都不便宜,需要注意
> 找一段时间体验能接触到的各种 AI 模型,在实践中摸索模型的风格、能力边界。
### 我正在使用的提示词(仅供参考)
```prompt
下面是一个讲座的字幕内容,请整理成文字稿:
注意:
删除语气词、口吃和过于口语化的表述;
添加小标题。
输出为带章节结构的Markdown格式,标题内容禁止使用加粗或斜体强调
警告:
务必不要偷懒,不要丢内容。
如有明确的广告内容(如宣传牙刷、护发素等产品),请直接跳过。
语音识别能力有限,如果该主题为讲解学科知识的课程实录,则:
公式定理等识别会出现问题,请根据授课内容适当补充公式和知识点,禁止过度补充。除了知识授课,如果提到其他课堂相关的内容,如作业、考试安排等内容,务必需要整理出来。
如果涉及多人对话,则:
明确不同发言的身份,不要混在一起;
明确发言人主次
请根据主题自动调整字幕
```
> 采用工程师思维,不要追求提示词的美观,能与模型配合得到有效输出的提示词就是好提示词(*猫论*)
根据目标不同选择不同的约束,比如:
- md 格式适合在笔记软件中保存;
- html 格式支持复杂表格;
- b 站评论区仅支持纯文本且每条评论限 1000 字,需要用特殊符号,如 `①②③`、`·`、`「」`、`▶` 等提高易读性
## 4-进阶:如何一键生成完善的 B 站视频笔记?
遇到的问题和发现:
在 AI 聊天中复制 md 格式的全文粘贴,得到的是未渲染的原始字符
![[AI视频总结视频大纲--2026-03-30-11-09-39-822.png|323]]
在 AI 聊天中划线选中全文复制并粘贴,得到的是部分符合要求的笔记
![[AI视频总结视频大纲--2026-03-30-11-11-53-757.png|287]] ![[AI视频总结视频大纲--2026-03-30-11-11-32-485.png|309]]
复制带格式的 B 站笔记并粘贴,能够 100%粘贴。
更多例子:复制 Excel 表格在不同界面中粘贴能得到图片、纯文本、带制表符的表格、格式完整的表格……
**请思考**:
- 这是为什么?
- 如何利用这些特性让 AI 一次性生成格式完善的笔记内容?
剪切板的原理:一切皆文本
> [!note]- 剪贴板的原理:一切皆文本,但有多个版本
>
>
> 简单说,剪贴板就像一个"临时仓库",但它很聪明——当你复制文字时,它会同时保存多种"版本":
>
> - **纯文本版本**:只有字符,没有任何格式(如 `## 标题` `**加粗**`)
> - **富文本版本**:包含格式代码,能显示真正的标题、加粗、列表等效果
>
> 不同软件粘贴时会"各取所需":
> - **AI 对话框、命令行**:只认纯文本,所以粘贴 Markdown 会显示原始符号
> - **B站笔记、富文本编辑器**:优先读取富文本版本,自动渲染成漂亮格式
>
> 这就解释了前面的现象:
> - 直接复制 AI 输出的代码块 → 只有纯文本 → 粘贴后是原始 Markdown 符号
> - 用鼠标划线选中 AI 界面上**已经渲染好看的文字** → 包含富文本格式 → 粘贴后完美还原
>
> **如何利用?**
> 在提示词中要求 AI 输出带格式的文本,然后用鼠标划线复制(不要点代码复制按钮),粘贴到 B 站笔记区就能一键生成排版完美的笔记,省去手动调格式的时间。
>
应用
![[AI视频总结视频大纲--2026-03-31-11-22-46-256.png|368]]
改进后的提示词
```改进后的提示词
……
你输出的内容会被放到B站笔记中,下面对输出语法格式进行规范:
使用html语法,禁止使用md或latex。【直接输出内容本体,无需用代码块包裹】。
详细情参考:
<html>
<body>
<!--StartFragment--><p style="margin: 0px 0px 10px; padding: 0px; scrollbar-color: rgb(170, 170, 170) transparent; scrollbar-width: thin !important; cursor: text;
……
```
启发:
- 面对枯燥的重复性任务,拥有 “AI first” 的思维
- 在 AI 时代,不必须精通一项计算机技术,但了解一些信息技术的底层原理会很有用
- 无需系统学习,需求出发,按需了解
- 好奇心的价值
---
BTW:非计算机专业的学生,如无必要,不要考任何计算机证件
![[AI视频总结视频大纲--2026-03-31-11-27-41-623.png|428]]
![[AI视频总结视频大纲--2026-03-31-11-28-54-018.png|444]]
## 5-结语
这套工作流的优势:
1. 节省时间
- 视频时间越长,收益越大
- 一维线性视频转换成二维文字,可以快速跳过不感兴趣的部分
2. 更适配 AI,可以和 AI 就视频内容进行讨论
3. 便于收藏保存和回顾,减少记笔记的时间
这套工作流的局限:
1. **依赖转文字识别精度**
2. **依赖模型能力**
- 模型介入越多,信息损失和扭曲越大
- 比如一个有个性的教授授课时说“希望你们毕业后能够从事科学研究,或者从事其他没那么重要的工作时……”,其中“没那么重要”可能会被模型理解为识别错误,改为“同样重要”
3. **对多人对话兼容性差**
- 解决方案是给每个对话打上来源戳,介绍一些能实现该功能的工具
4. **尚没有一键式解决方案**
- 可以包装成一个 Skills,但我不怎么用
5. **仅适用于侧重信息型视频**(如课程、讲座),不适用于侧重画面、非文本(如音调、语气、个人魅力)内容的总结
*有人说只读 AI 总结等于让渡了自己筛选、加工信息的权利* :
- 通读一份清晰美观的文章相较于原视频,提高了信息密度,但减少了处理信息的时间。
- 文章的加粗标记让人更多将注意力放在结论,而非论证过程,长此以往可能会降低批判性思维;
- 阅读文章带来的流畅性会让人误以为自己理解、掌握,但其实并没有;
解决:
- **提示词中应明确约束**,究竟是生成笔记(抽象程度高)还是文字稿(兼顾字数和信息),亦或是逐字稿(删除“嗯啊这是”,几乎保留所有文字信息)
- 对不同类型的场景采用**不同的策略**:
- 有若干视频,丢给 AI 转成文字稿,快速筛选对自己有价值的内容
- 需要重点理解、学习的视频,分配更多的精力,阅读数遍,通读
- 原长一小时的视频拿出接近一小时的时间学习文字稿,不清楚的部分回归视频,以获得更好的效果,而不是原长一小时的视频用看消遣读物的速度花 1 分钟浏览
### 作业
**作业 1**:用 AI 生成这个视频的文字稿或笔记发在这个视频下。
- 100%使用 AI 生成
- 可以附上你使用的提示词以及模型
**作业 2**:在视频下方整理你在体验各模型后对它们的理解。
- 可以用 AI 辅助,但最终需要人工整理
### 下期视频预告:
Excel 记账工作流
“每天半分钟,记账超轻松”