兄弟们,不知道你们在生活、工作中有没有遇到过这样的场景:将视频或者音频转换为可以编辑的文字

这样的场景一般来说只需要用音频识别就可以实现,但是单纯的音频识别经常会出现错字、错词等情况。

今天,给大家分享一个刚刚发现的利用 AI 将视频或音频转为文本的开源工具:AI-Media2Doc。目前在Github上已经斩获了2.3K Star。下面我们一起来看看吧!

图片

一、介绍

AI-Media2Doc 又称「AI视频图文创作助手」,是一款基于 AI 大模型的 Web 工具,能够一键将视频和音频转化为各种风格的文档。

图片

它采用前后端本地部署的方式,无需登录注册,让你以极低的成本体验 AI 视频 / 音频转风格文档服务。

该项目完全开源,基于 MIT 协议授权,你可以自由使用和二次开发。

二、功能特性

  • 隐私保护到位:无需登录注册,所有任务记录都保存在本地,不用担心内容泄露。

  • 前端高效处理:采用 ffmpeg wasm 技术,无需在本地安装 ffmpeg,降低了使用门槛。

  • 多种风格支持:可将内容转化为小红书、公众号、知识笔记、思维导图、内容总结等多种风格。

图片

  • AI 对话功能:支持针对视频内容进行 AI 二次问答,深入挖掘内容价值。

  • 字幕导出便捷:处理结果可一键导出为字幕文件,满足多场景需求。

图片

  • 智能截图插入:基于字幕信息智能截图并插入文章,无需视觉大模型,实现图文并茂。

图片

  • 自定义 Prompt 灵活:支持在前端自定义配置 prompt,让输出更符合个人需求。

图片

  • 部署简单快捷:支持 Docker 一键部署,上手容易。

图片

  • 访问密码设置:后端设置访问密码后,前端用户需填写密码才能使用,增加安全性。

图片

三、安装

首先需要安装Docker,这里不再赘述。

然后克隆代码库:

git clone https://github.com/hanshuaikang/AI-Media2Doc.git

在项目目录,执行下面的命令构建镜像:

make docker-image

图片

然后配置一下variables.env文件,文件内容如下:

MODEL_ID=xxx
LLM_API_KEY=xxx
TOS_ACCESS_KEY=xxx
TOS_SECRET_KEY=xxx
TOS_ENDPOINT=xxx
TOS_REGION=xxx
TOS_BUCKET=xxx
AUC_APP_ID=xxx
AUC_ACCESS_TOKEN=xxx
AUC_CLUSTER_ID=XXX
# 如果不需要密码访问,请留空或者删除此行
WEB_ACCESS_PASSWORD=
# 默认使用字节火山方舟的大模型服务
LLM_BASE_URL=https://ark.cn-beijing.volces.com/api/v3

这个文件中的参数说明如下:

  • MODEL_ID:火山引擎对应的Model_ID

  • LLM_API_KEY:火山引擎的API_KEY

  • TOS_ACCESS_KEY:火山引擎对象存储服务的ACCESS_KEY

  • TOS_SECRET_KEY:火山引擎对象存储服务的SECRET_KEY

  • TOS_ENDPOINT:火山引擎对象存储服务的ENDPOINT

  • TOS_REGION:火山引擎对象存储的bucket区域

  • TOS_BUCKET:火山引擎对象存储的bucket名称

  • AUC_APP_ID:音频识别大模型的APP_ID

  • AUC_ACCESS_TOKEN:音频识别大模型的ACCESS_TOKEN

  • AUC_CLUSTER_ID:音频识别大模型的CLUSTER_ID

  • WEB_ACCESS_PASSWORD:网页应用访问密码

  • LLM_BASE_URL:大模型地址,默认使用火山方舟的大模型

然后执行下面的命令启动容器:

make run

出现下面的内容表示启动成功:

图片

四、体验

在浏览器输入http://127.0.0.1:5173,即可进入到首页:

图片

可以看到,这个工具可以直接视频或者MP3音频转换为知识笔记、小红书、公众号、内容总结、思维导图、字幕文件。

下面我们来试一下,上传一个音频文件,并要求它转为「思维导图」:

图片

在点击「开始处理」之后,就吭哧吭哧的处理了:

图片

下面是处理的结果:

图片

可以看到生成思维导图的效果还是很好的。

下面再试试「内容总结」:

图片

看看「小红书」图文生成的怎么样:

图片

我们可以在页面左侧看到生成的历史记录:

图片

同样可以设置不同文本类型的提示词:

图片

也可以设置智能截图,自动为生成的内容添加相关图片,提升视觉效果。

图片

还有更多其他的功能大家可以自行尝试!

五、如何学习AI大模型?

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

这份完整版的大模型 AI 学习和面试资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

在这里插入图片描述

第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;

第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;

第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;

第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;

第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;

第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;

第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。

在这里插入图片描述

👉学会后的收获:👈

• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;

• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;

• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;

• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

在这里插入图片描述

1.AI大模型学习路线图
2.100套AI大模型商业化落地方案
3.100集大模型视频教程
4.200本大模型PDF书籍
5.LLM面试题合集
6.AI产品经理资源合集

👉获取方式:
😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

在这里插入图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐