EDIT
编辑模式 · 点击文字即可修改 · Ctrl+S 导出
再次按 E 或点击左上角退出
☾
模块 6.2 · 换芯不换壳
让网页真的会分析文字
换芯不换壳:只改实现,不动约定
从「试过」到「用上」
库找好了,这一节把它接进项目
上一节 · 找库 · 验库
✓
在 Python 生态里找到
pypinyin
、
snownlp
✓
验过:靠谱、也合用
✓
在
REPL
里敲两下,确认能跑
但这还只是在命令台上「试过」
这一节 · 接进项目
▶
把两个库装进
/api/analyze
▶
占位假值 →
真模型现算
▶
文字实验室,
真的会分析
了
从「试过」 →
「用上」
前端一行没改
为什么前端不用改?
👩💻
前端
:3000
👁 只认约定
▶
接口约定 · 没变
/api/analyze
POST · { text }
text·score·label·pinyin
▶
🖥️
后端
:8000
┈▶
🔧 实现 · 可换芯(前端看不到)
现在:
SnowNLP · score_label · lazy_pinyin
换成 Java、换个大模型…… 都行
为什么会翻车
模型的边界
模型能力的边界
边界之外 · 训练时没见过的那类数据 → 抓瞎、翻车 ✗
训练时「见过」的那类数据 → 判得准 ✓
snownlp 见过的,是商品评论——好评差评这类「像评论的句子」
两条路,摆一起比
小模型,还是大模型 API?
本地小模型
snownlp
大模型 API
如 DeepSeek
花钱
免费
按量计费
联网
不需要
必须联网
速度
本地毫秒级
网络往返+推理,秒级
准确度
够用,边界明显
强得多,连反讽都懂
隐私
数据不出自己的机器
用户文本要发给第三方
一条连续的谱系
从小模型,到大模型
开源大模型 · 本地 / 私有化部署
NLP 模型
如 snownlp
传统小模型
1.5B
7B
70B
671B
云端 API
调别人的大模型
越小越轻、越省、越快
越大越强、越吃机器、越慢
方框里都是
同一类「开源大模型」,只是尺寸不同
;而左边的 NLP 模型是
另一类
,不是「更小的大模型」。
下一节
下一节,
给它
记忆
让分析结果存下来——用户查过的句子,用完不再即弃。
数据库
来了。