d1-3B 接收文本和图像;600M 版本分别支持文本加图像、文本加音频,仍属早期研究版本。

Liquid AI 报告,d1-3B 单问题测试在 Jetson AGX Thor 上耗时16毫秒、Orin Nano上50毫秒;较长输入和图像任务耗时更高,不能将这些数字视为任意负载的延迟承诺。

官方示例支持对同一输入并行提出多个命名问题,返回分类或评分;发布页未提供600M版本速度结果,也未公布视觉或音频基准成绩。

影响与意义

对需要快速判断意图、选择工具或分流请求的团队,这是把决策与长文本生成拆开的实现选项。评估时应使用真实输入长度和模态,比较误判成本、延迟与设备内存,而非只看模型参数量。

可用性与限制

两款权重已在 Hugging Face 提供。官方示例要求 Transformers 5.14及以上并加载模型自带代码,部署前应审查代码与各模型许可;本次没有安装或运行模型。

官方来源