d1-3B 接收文本和图像;600M 版本分别支持文本加图像、文本加音频,仍属早期研究版本。
Liquid AI 报告,d1-3B 单问题测试在 Jetson AGX Thor 上耗时16毫秒、Orin Nano上50毫秒;较长输入和图像任务耗时更高,不能将这些数字视为任意负载的延迟承诺。
官方示例支持对同一输入并行提出多个命名问题,返回分类或评分;发布页未提供600M版本速度结果,也未公布视觉或音频基准成绩。
影响与意义
对需要快速判断意图、选择工具或分流请求的团队,这是把决策与长文本生成拆开的实现选项。评估时应使用真实输入长度和模态,比较误判成本、延迟与设备内存,而非只看模型参数量。
可用性与限制
两款权重已在 Hugging Face 提供。官方示例要求 Transformers 5.14及以上并加载模型自带代码,部署前应审查代码与各模型许可;本次没有安装或运行模型。
官方来源
- Multimodal open d1 decision models for the edge
发布时间:2026-10-07T16:54:33.000Z;发现时间:2026-10-08T01:32:46.426Z