MinerU:高效精准的文档解析技术攻坚
OpenCompass 大模型评测
1. MMDetection3D 介绍及安装配置
书生科学大模型Intern-S2-Preview开源!
从“一人盯一机”到“两人十二机”:HELP发布,提升大规模机器人后训练人效
1. PyTorch 模型部署基础知识
Label Studio x Segment Anything Model 半自动化标注
如果从头搭建一个面向真实商业场景的文档解析系统(如合同、发票、报表等),有哪些关键建议可以给到开发者?
多模态简述
从开源视角看,当前 OCR 工业级工具链或范式还有哪些关键缺失?如果不考虑商业化,最想推动或实现的 OCR 方向是什么?
利用智能体解锁地球观测的完整图景
下一代多模态大模型能力演进的度量分析
1T MoE 科学多模态大模型Intern-S1-Pro来啦!
能否分享最近关注、但本次尚未提及的 OCR 前沿工作?对于希望参与贡献开源项目的开发者,有哪些建议?
大模型评测基准发展趋势探讨
OCR 模型是否还有必要加入推理能力吗?主要会用于什么样的场景,会用怎样的形式出现?
基于多模态大模型的图像评价及应用探索
NewtonBench:在“平行宇宙”中评估大模型科学发现能力
国产开源、免费的 AI 图像与视频创作平台MagicMaker,新手教程来啦!
极致端侧推理、结构还原与语义泛化三者之间存在天然的张力,在设计模型架构或训练策略时,如何权衡这三者之间的 trade-off 的?