AI模型社 | DocMaster:基于大模型和OCR的精准文档解析Agent

1.3万
15
2023-08-10 13:55:23
256
119
1000
218
体验链接:https://modelscope.cn/studios/iic/DocMaster/summary?from=blibli_video
让模型应用更简单!
AI模型社
(17/74)
自动连播
10.5万播放
简介
【文生视频模型】文本生成视频大模型
48:18
【全自动化视觉工作-GroundedSAM】GroundedSAM 马赛克熊:自动化检测、分割、生成一切
44:42
【人像卡通化模型】工业级轻量AI人像漫画开源模型技术解析
01:13:28
【个性化语音定制模型-PTTS】个性化语音合成开源模型技术解析及应用
42:49
【视频文本跨模态检索模型-VoP】视频文本跨模态检索模型解析与应用
30:06
【多任务多模态地址预训练底座-MGeo】1-1 MGeo模型应用介绍
31:26
【多任务多模态地址预训练底座-MGeo】1-2 MGeo模型应用介绍
21:18
【多任务多模态地址预训练底座-MGeo】1-3 MGeo模型应用介绍
21:18
Duang~用AI打开变形咒
03:41
XPLUG:开放域对话大模型技术与应用解析
58:53
mPLUG:达摩院多模态对话大模型技术解析及应用
47:14
封神榜模型上新!揭秘姜子牙通用大模型
01:10:55
Fastlnst激发查询在实时实例分割领域的强大潜力
40:33
听声辨人:准确识别说话
01:03:39
ModelScopeGPT-大小模型协同Agent系统
01:12:04
探访KnowLM团队:基于大模型探索知识图谱抽取新边界
01:12:56
基于大模型和OCR的精准文档解析Agent
01:25:27
Chat凉宫春日:打造30个IP人物的中文聊天语言模型
01:19:31
AI模型社 I PolyLM:通晓多种语言的大规模语言模型
01:24:58
AI图像流转:AI驱动视频创作的魅力
01:26:19
AI模型社 I 重现经典:AI照片和视频上色回顾与最新技术解析
01:02:46
SeqGPT:开箱即用的开放域自然语言理解大模型
49:10
开源可商用:工业级语音识别服务部署介绍
58:58
AI模型社 | DAIL-SQL:发掘大模型的NL2SQL能力
01:07:37
AI模型社 | GTE:大模型驱动的统一文本表示
43:15
AI模型社 | CodeShell:本地化轻量化的智能代码助手
59:06
AI模型社 | 零一万物Yi系列:拥抱开源,构筑活力生态迎接AGI时代
02:06:04
AI模型社 | SCEdit:轻量级高效可控的AI图像生成微调框架
53:22
AI模型社|基于OCR开源模型和免费API构建商用文档解析Agent
01:18:52
AI模型社 | AnyText:破解绘画模型生成文字难题
01:31:59
AI模型社|WordArt锦书:基于用户驱动与大语言模型的创意文字生成
01:38:14
AI模型社 | 破晓未来视界:从Sora技术洞见到视觉生成技术新生态探索
01:31:13
多模态数据智能工厂:DataJuicer & Dj-SORA
56:47
AI模型社 | mPLUG-DocOwl:多模态文档理解大模型
50:09
AI模型社 | 通义mPLUG-Owl2:模态协同多模态大模型技术解析及应用
43:45
AI模型社 | 有道QAnything背后的故事:关于RAG的一点经验分享
01:23:07
AI模型社 | 3D-Speaker:多模态说话人开源项目介绍
01:03:25
AI模型社 | Mobile-Agent:多模态手机智能体技术解析与应用
53:50
AI模型社 | MimicBrush:奇迹画刷,重新定义局部重绘
01:07:34
AI模型社 | FunAudioLLM:通义语音大模型最新开源
01:12:12
LMDeploy部署VLMs的方法与探讨
01:40:04
AI模型社 | 探索大模型微调的高效方法
01:10:39
mPLUG-Owl3:高效长序列通用多模态大模型技术解析
01:02:09
AI模型社 | 更大分辨率、更长时间:探索CogVideoX的潜力
01:05:18
AI模型社 | mPLUG-DocOwl 2: 多模态多页文档理解大模型
01:00:10
AI模型社 | Hallo2: 音频驱动的长时间、高分辨率人像动画生成
51:03
AI模型社 | Tora:可定制轨迹的高质量视频生成框架
55:58
AI模型社 | 基于MNN的端侧LLM部署与性能优化
01:03:39
AI模型社 | MagicQuill:赛博"神笔马良",智能交互式精准图像编辑开源框架
01:26:01
AI模型社 | ACE: 通用编辑和生成扩散模型
56:15
AI模型社 | MIMO: 可控角色视频生成模型技术解析&应用
50:47
AI模型社 | 硅谷小模型技术及开源社区实践
59:25
AI模型社 | GME:大模型驱动的统一多模态embedding
52:30
AI模型社 | Powerinfer系列:端侧推理框架技术分享
47:57
AI模型社 | OS-Genesis:为GUI智能体构筑数据基建
01:13:52
AI模型社 | Qwen-VL:让通用视觉语言模型更好地看世界
01:46:23
AI模型社 | 不只是搜索,从“搬运”到“思索”: 通义实验室Agentic RAG技术分享
01:12:50
AI模型社 | R1-Omni:让各模态作用清晰可见
59:04
OpenManus×MCP:开源智能新篇章
01:13:34
AI模型社 | 群核科技空间理解模型 SptialLM,让机器人“看懂”三维世界
55:46
AI模型社 | ROLL: 高效且用户友好的大模型RL训练框架
01:04:25
AI模型社 | 群核空间大模型: 推动AI走向物理世界
01:06:37
AI模型社 | 智元 Genie Envisioner 深度解析
58:34
AI模型社 | 通义Mobile-Agent-v3: 多模态、多端GUI智能体
01:13:40
KAT-Coder系列模型技术分享
01:17:11
阶跃GUI Agent 模型技术
01:21:43
FireRed-Image-Edit:小红书极致数据工程驱动图像编辑新SOTA-王润奇分享
16:14
FireRed-Image-Edit:小红书极致数据工程驱动图像编辑新SOTA-乔长浩分享
22:22
WBench:面向交互式视频世界模型的综合多轮评测基准
01:03:50
阿里RTPurboV2:原生Transformer再次崛起,百步训练实现10倍稀疏注意力
43:32
AI模型社 | Nex:下一代能动性模型体系
01:11:51
Nex-N2:当推理遇上行动,能动性思维的统一
01:31:59
高德DreamX-World: 实时可交互世界模型
57:36
预训练后即可部署: Wall-05S-0.5的训练与推理拆解
01:19:29
客服
顶部
赛事库 课堂 2021拜年纪