跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–15 条 · 共 15 条
9月3日周四
9月2日周三
8月28日周五
8月25日周二
  1. Hugging Face Blog79

    Gradio gr.Workflow 支持用画布构建、运行和部署 AI 工作流

    Gradio 的 gr.Workflow 将 AI 应用管线描述为类型化节点图,并提供拖拽画布,让每个节点可运行、中间结果可见。同一图也会成为 REST API,并可一条命令部署到 Hugging Face Spaces。

    推荐理由:原文展示了 gr.Workflow 如何把多步 AI 管线做成可运行画布和 REST API,便于复用到 Gradio 应用。

8月12日周三
8月10日周一
8月4日周二
  1. Mistral AI67

    Mistral AI 发布 Shieldstral 3B 开放权重多模态安全分类器

    Mistral AI 发布 Shieldstral,一个 3B 开放权重、策略自适应的多模态安全分类器。它在推理时接受自然语言政策问题,将文本和图像安全评估统一为二元问答任务,无需重训,并输出校准后的安全分数。

    推荐理由:它把内容审核改写为可提问的安全判断,为需要按场景调整策略且不想重训的产品提供参考。

7月30日周四
7月28日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Robotics 2,面向机器人全身控制、灵巧操作与协作

    Google DeepMind 发布 Gemini Robotics 2,包括 Gemini Robotics 2、Gemini Robotics ER 2 和 Gemini Robotics On-Device 2 三个模型,面向机器人全身控制、双手或夹爪灵巧操作和多机器人协作。

    推荐理由:原文同时列出云端、端侧和安全评测细节,可用于理解机器人模型从演示走向部署的路径。

7月21日周二
7月8日周三
5月18日周一
5月17日周日
3月17日周二
12月3日周三