欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Ternlight:7MB 的轻量级嵌入模型,在浏览器中用 WASM 跑出高性能

2026/7/7人工智能

一个仅 7MB 的嵌入模型,通过 WASM 在浏览器内运行,实现低延迟、高精度的本地向量化推理,无需服务器或 GPU。

背景:为什么需要浏览器内嵌入模型?

近年来,嵌入模型(embedding model)已成为 NLP 应用的核心组件,尤其是在语义搜索、推荐系统、RAG(检索增强生成)等场景中。传统嵌入模型如 OpenAI 的 text-embedding-ada-002 或开源的 BERT 系列,通常需要服务器端推理,依赖 GPU 或大量 CPU 资源,且存在网络延迟和数据隐私问题。

Ternlight 的突破在于:它将一个高质量的嵌入模型压缩至 7MB,并通过 WebAssembly(WASM)在浏览器中直接运行,无需任何后端服务。这意味着开发者可以在客户端完成文本向量化,实现毫秒级推理,同时数据完全留在本地,适合隐私敏感或离线场景。

技术细节:7MB 模型如何实现?

Ternlight 基于 Sentence Transformers 架构,但通过以下技术进行了极致压缩:

  1. 模型量化:将权重从 FP32 降至 INT8,体积缩小约 4 倍,同时通过校准数据微调量化参数,保持精度下降在可接受范围内(在多个 benchmark 上精度损失 <2%)。
  2. 知识蒸馏:以更大模型(如 all-MiniLM-L6-v2,约 80MB)为教师模型,训练一个更小的学生模型(仅 2 层 Transformer),损失函数包括均方误差和对比学习损失,保证嵌入空间的语义一致性。
  3. WASM 优化:模型推理逻辑用 Rust 重写,编译为 WASM,利用 SIMD(单指令多数据流)指令加速矩阵运算。浏览器端的推理速度可达每秒 100+ 次(取决于硬件),与原生 Python 推理相当。

性能与精度:不是“玩具”模型

Ternlight 在多个标准语义相似度任务(如 STS-B、SICK-R、Amazon Reviews)上的表现令人惊讶:

  • STS-B:Spearman 相关系数 0.82(原教师模型 0.84)
  • SICK-R:Pearson 相关系数 0.79(教师模型 0.81)
  • 平均精度损失:约 2-3%,远低于同类轻量模型(如 MiniLM-L2-v6 损失 5-8%)

这意味着在大多数实际场景中,Ternlight 的嵌入质量足以替代传统服务器端模型,尤其适合对延迟敏感的应用(如实时搜索、聊天机器人上下文检索)。

使用方式:一行代码集成

Ternlight 提供了简洁的 JavaScript API:

javascript
import { Ternlight } from 'ternlight';

const model = await Ternlight.create();
const embedding = await model.embed('Hello, world!');
// embedding 是一个 384 维的 Float32Array

模型文件通过 CDN 按需下载,首次加载后缓存至 IndexedDB,后续使用无需网络。整个库(包括 WASM 二进制)约 7MB,对比传统模型动辄数百 MB 的依赖,对前端应用非常友好。

应用场景与局限

适用场景:

  • 客户端语义搜索(如本地文档检索、笔记应用)
  • 隐私优先的 RAG 系统(敏感数据不离开浏览器)
  • 离线或弱网环境下的 NLP 任务
  • 低预算项目(无需 GPU 服务器)

当前局限:

  • 最大输入长度 256 tokens,超过需截断
  • 不支持多语言(仅英文)
  • 在移动端性能较低(推理时间约 50-100ms)

总结

Ternlight 展示了“小而美”的 AI 落地思路:通过量化、蒸馏和 WASM 优化,让嵌入模型从云端走向边缘。它并非全能,但在浏览器端语义理解领域树立了一个新标杆——7MB 就能跑出接近大模型 90% 的性能。对于前端开发者、独立开发者以及隐私敏感的应用,这是一个值得关注的工具。

原文链接:https://ternlight-demo.vercel.app/

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消