数据集
107 个数据集
热门分类:
nari-labs/Dia-1.6B
已完整同步
Dia是一个拥有1.6B参数的文本到语音模型,能够直接从脚本生成高度逼真的对话。它支持通过音频条件控制情感和语调,还能输出笑声、咳嗽等非语言声音。目前仅支持英文生成。
Qwen/QwQ-32B
已完整同步
QwQ-32B是Qwen系列中的推理模型,拥有32.5B参数,基于Transformer架构,支持最长131,072 tokens的上下文。它经过预训练、监督微调与强化学习,具备深度思考与推理能力,在复杂任务上表现优异,可对标业界领先的推理模型。
Spark-TTS 是一个基于大语言模型的高效文本转语音系统,专门用于生成自然、准确的语音。它完全构建在 Qwen2.5 之上,无需额外的流匹配等生成模型,而是直接通过 LLM 预测的代码重构音频,大幅简化了流程并提升了效率。系统支持中文和英文双语,具备零样本语音克隆能力,能够在不依赖特定训练数据的情况下复制说话人的声音,并实现跨语言和语码切换场景的无缝合成。此外,Spark-TTS 还支持可控语音生成,用户可以通过调整性别、音高、语速等参数来创建虚拟说话人,灵活性很强。
MedAIBase/AntAngelMed
已完整同步
AntAngelMed 是当前最大的开源医疗语言模型,由浙江省卫健委、蚂蚁集团及浙江省安诊儿医学人工智能科技有限公司联合研发。它在 OpenAI 的 HealthBench 和中文权威评测 MedAIBench 上均取得领先成绩,尤其在 Hard 子集上表现突出。该模型采用高效 MoE 架构,总参数 100B 但仅激活 6.1B,推理速度可达 200 tokens/s 以上,同时支持 128K 上下文长度。通过医学语料持续预训练、高质量指令微调及 GRPO 强化学习,模型具备了深入的医学知识、严谨的诊断推理能力以及良好的安全伦理遵循。
jetmoe/jetmoe-8b
已完整同步
JetMoE-8B 是一个高效的大语言模型,仅需极低的训练成本就能达到甚至超越 LLaMA2-7B 的性能。它在推理时只有 2.2B 活跃参数,大幅降低了计算开销,同时优于计算量相近的模型(如 Gemma-2B)。该模型完全基于公开数据集训练,代码开源,便于在普通消费级 GPU 上进行微调,适合学术研究场景。
该数据集专为医学大语言模型 HuatuoGPT-o1 的微调设计,包含英文、中文及混合指令等多个版本。数据基于可验证的医学问题构建,通过 GPT-4o 生成推理过程并由医学验证器校验,旨在提升模型在复杂医学推理任务中的表现。
这是一个为 OSWorld 项目提供评估文件缓存的数据集,包含大量用于多模态代理评测的各类文件,覆盖 Chrome、Firefox、GIMP、LibreOffice(Calc、Impress、Writer)、Thunderbird、VS Code 等多个应用场景。文件组织方式按应用分类,每个目录下再按具体评测场景细分,存放图片、文档、电子表格、演示文稿、媒体文件、数据集和配置文件等。该缓存旨在提升文件访问的可靠性和速度,确保评测资源稳定可用,支持直接通过文件路径或编程方式获取。