Prime Intellect开放Lab平台:Agent后训练做成闭环,按token计费不按GPU时长

据动察 Beating 监测,分布式 AI 训练公司 Prime Intellect 将其 Agent 后训练平台 Lab 从 beta 转为正式版。Lab 把评估、强化学习(RL)训练、适配器部署和推理整合成一条闭环:用户定义任务和评分标准,平台自动驱动模型在任务中反复试错、收集奖励信号、训练 LoRA 适配器(一种参数高效的微调方法,只更新模型的一小部分权重),再把新权重部署上线继续迭代。平台的核心抽象是 Environment,打包了任务数据、模型 harness、沙箱和奖励指标,同一个 Environment 可以直接复用于本地开发、托管评估、合成数据生成和 RL 训练。训练按 token 计费而非按 GPU 时长,底层基于公司开源的 prime-rl 框架。GA 首批支持英伟达、OpenAI、Meta 和 Qwen 的 14 个模型,参数从 1B 到 70B,覆盖稠密和 MoE 架构。Prime Intellect 2023 年成立,由 Vincent Weisser 和 Johannes Hagemann 创办,累计融资超 7000 万美元,A 轮 Founders Fund 领投,B 轮 Radical Ventures 领投。公司此前以分布式训练开源前沿模型知名,曾发布 1060 亿参数 MoE 模型 INTELLECT-3。Beta 期间已有数百名用户在平台上跑了超过 1 万个训练任务。

上一篇:

下一篇:

风险提示:理性看待区块链,提高风险意识!