当前位置:
AIGC文章详情

DeepSeek视觉实测、轻量统一模型 | 多模态大模型8.23日报

源自189位全网作者

08:52

正在加载内容...

内容由AI生成

精选参考来源

1. DeepSeek-V4-Flash-Vision-Exp 实测:截图识别可用,需控制 `reasoning_effort`

2. DeepSeek-V4-Flash-Vision-Exp 实测:DeepSeek 终于给 Agent 装上了眼睛

3. DeepSeek 首个视觉模型实测:一个多模态,差距这么大?

4. 别急着吹 DeepSeek 多模态!1亿 Token 实测告诉你真相

5. 给大家写了个 deepseek-v4-flash-vision-exp 输入视频教程 deepseek 最近真的是高产, 刚刚又发了 deepseek-v4-flash-vision-exp, 首个多模态【大】模型. 而且是 v4-flash 能力级别的. 但是! 虽然不是瞎子了, 但是还是听力有问题, 不支持音频输入. 所以默认 deepseek 官网和API都不支持视频输入, 于是给大家写了个小教程, 如何使用这个模型处理视频.简单来讲, 方法就是直接把视频抽帧. 而且需要注意, 虽然模型支持gif输入, 但是它只识别 gif 的第一帧(我写代码验证了). 所以把视频转换为gif是行不通的.抽帧的最佳实践也给大家: 把视频抽成 JPEG/PNG, 按时间顺序作为多个 `image_url` 传入, 并在 prompt 里写明采样率和时间轴. 这样分析会更准确. 我使用了一个猫和老鼠的片段进行分析, 这样做模型识别很准确.另外, 我还用了一段 CS2 录像来验证分析快速动作时的最佳方案, 结论是不要匀速抽全片, 用「宏观 1fps 全图 + 事件窗口高帧率中心放大」两级采样。效果会更好.详细教程和POV开源在这里: github.com/karminski/deepseek-v4-flash-vision-exp-video-input-best-practice#HOW I AI##deepseekv4flashvisionexp##deepseek多模态##deepseek多模态模型#

6. 对了,昨天 DeepSeek 不是发了多模态模型 DeepSeek-V4-Flash-Vision-Exp 嘛,有个细节是这个模型最大支持图片 token 数是 384 个,图片进入前会进行缩放。那这个细节有什么用,用处就是如果你是一个很长的文本内容,其实你可以直接用图片表示,这样会更省 token,呐,就是这个意思。

7. 阿里国际发布最新版多模态大模型 Ovis,该模型设计有哪些创新之处?

8. 商汤开源 8b 参数量多模态大模型,原生支持 4k 图像输出,这一技术突破意味着什么?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章