关于本站 · About
炼丹社的免费推理服务
一个由社团自费搭建、运行的 OpenAI 兼容 API,面向实验校内开放。
这是什么
这是炼丹社自费部署的推理服务,免费开放给炼丹社社团群与
groovin 用户群的成员学习和做项目使用。
通过标准 OpenAI 接口提供,任何支持 OpenAI 的 SDK / 编辑器插件都能直接接上。
模型与硬件
- 常驻
Stella(默认)与 Aurora,
跑在 Apple M 系芯片 · 128GB 统一内存 上,长期在线,但受内存约束上下文有限制(Stella 24K / Aurora 32K,为记账口径,实际可放约 96%,详见帮助文档)。
- 限时福利
Novus(NVFP4 量化 + MTP),跑在部署者自己的 RTX PRO 6000 显卡上,
速度快、跑分高,但可能不定时下线去跑别的实验,恕不另行通知,敬请谅解。
- 向量与搜索
Sextant(文本向量)与 Pharos(联网搜索),
和两个常驻对话模型同一台机器,长期在线。搜索按定义要出外网,检索用的是本机自建的 SearXNG。
- 视频
Lanterna(文生 / 图生 / 参考生视频,输出自带同步立体声),
跑在一台 A800 上。一条要几分钟到半小时,所以接口是异步的:提交拿 id、之后轮询。
产物取回本机后不留在那台机器上,本地暂存 7 天。
跑分数据与每模型限额见帮助文档。
怎么获得使用权
本服务不对外开放注册。请设法进入
炼丹社社团群或
groovin 用户群,
找
群主要一张
激活码,
到
首页兑换成你的专属 Key。一张激活码换一个 Key,用过即废。
能力(均经实测验证)
- 对话补全/v1/chat/completions,流式与非流式均支持
- 推理输出思考走 reasoning_content 字段,content 保持干净
- 函数调用tools / function calling,三个模型都返回标准 tool_calls
- 结构化输出response_format:{type:"json_schema"} + schema;不支持 json_object
- 文本向量/v1/embeddings,1024 维、已归一化,用于语义检索与 RAG
- 联网搜索/v1/search,Tavily 兼容;本机自建 SearXNG 检索,可选让模型写带引用的答案
- 视频生成/v1/videos(也保留 /v1/video/* 的原生形状),
提交 + 轮询的异步接口;输出 mp4 自带同步立体声,环境音、配乐和台词与画面一起生成
- 模型列表/v1/models 返回当前可用模型
公平使用
硬件有限,为了大家都能用,每个账号独立计量并设了限额:
- 5 小时窗口次数与 token 双限,滚动计算,触顶到点自动恢复
- 每周窗口同上,更长周期的总量保护
- 同时并发每个账号只能有少量请求同时在跑,避免单人占满
- 额度倍率不同模型按算力成本加权:Stella 最省、Novus 最贵、Sextant(向量)最低。
倍率会随后端调整而变,确切数值以首页与帮助文档里的实时表为准——
这里不写死,写死过一次就已经过期过一次
- 思考开销Aurora 与 Novus 会先思考,思考和正文共用 max_tokens,设小了会拿到空正文且照常计费;
网关已自动兜底(Aurora 3072、Novus 8192)。Stella 不思考,不受影响
- 文本向量/v1/embeddings 单条上限 4096 token、一次最多 128 条,
超出返回 413——请先分块。查询要加指令前缀、文档不加,弄反了不报错但检索会变差,详见帮助文档
具体数值见帮助文档,也可在那里查自己的实时用量。
鸣谢
本站提供的模型,权重来自 Google Gemma、通义千问 Qwen 与
MiniMax 三家的开源发布——对话与向量出自前两者,视频(Lanterna)用的是 MiniMax 的
H3。没有这些团队愿意把模型开源出来,这个社团服务根本不可能存在。
量化与推理还依赖 MLX、vLLM、
ComfyUI 等开源项目(视频那条链路整个跑在 ComfyUI 上),一并致谢。
数据与隐私
为便于排查问题与改进服务,本站会把经过的对话内容(你的提问与模型回复)记录到部署者本地的存储盘,
仅社团内部留存,不对外公开、不用于其它用途。介意的敏感信息请勿发送。
这是社团非盈利项目,仅供成员学习使用。请勿滥用、勿用于商业或违规用途;
不对输出内容负责。有问题在群里找群主。