WebGPU 实验特性
浏览器端 LLM 实验场
在浏览器内直接加载 WebLLM 模型,评估延迟、缓存与流式输出,无需依赖服务端接口。
WebGPU
OpenAI API Schema
⏳模型未加载
模型设置
选择预构建的权重包,首次加载会缓存到本地,体积较大的模型可能需要数分钟。
模型
加载模型
重置会话
对话控制台
模型加载完成后发送提问,观察延迟、流式输出与指令遵循程度。
当前尚无会话。模型准备就绪后,可以询问延迟体验、本地隐私场景或多轮指令,观察推理表现。
提问
请先加载模型再提问。
停止
发送