自然语言处理

NLP (Natural Language Processing)

自然语言处理(NLP,Natural Language Processing)是人工智能与语言学交叉的研究领域,旨在让计算机理解、生成、翻译和推理人类自然语言。

详细解释

自然语言处理(Natural Language Processing, NLP)是 AI 领域最古老、最活跃的方向之一,目标是「让机器读懂人话、写出人话」。从 1950 年图灵提出「图灵测试」开始,NLP 已经走过了 70 余年。

NLP 的核心任务

任务说明典型应用
文本分类判断文本类别垃圾邮件识别、情感分析
命名实体识别(NER)抽取人名、地名、机构信息抽取、知识图谱
机器翻译A 语言 → B 语言谷歌翻译、DeepL
文本生成给定上下文输出文本写作助手、ChatGPT
问答系统(QA)问 → 答智能客服、RAG
摘要长文 → 短文资讯摘要、研报生成
情感分析判断正负面舆情监控、商品评价
语音语音 ↔ 文本智能音箱、会议纪要

NLP 的发展简史

年代技术代表系统
1950s-1980s规则系统ELIZA
1990s-2010s统计学习(SVM、HMM)IBM 翻译模型
2013-2017神经网络(Word2Vec、LSTM)Google Neural MT
2017-2020Transformer + 预训练BERT、GPT-2、T5
2020-2024大模型(LLM)GPT-3、ChatGPT、Claude
2024-2026国产大模型 + AgentDeepSeek、GLM、Qwen、Kimi

NLP 与 LLM 的关系

LLM 是 NLP 在「生成式任务」上的集大成者,但它已经超越传统 NLP 的边界——具备推理、规划、工具调用能力,成为「通用人工智能」的重要候选。

常见问题

NLP 和 NLU 有什么区别?
NLU(Natural Language Understanding)特指「理解」侧,是 NLP 的子集。NLP 包含 NLU + NLG(Natural Language Generation,生成)。
中文 NLP 有什么特殊挑战?
中文分词歧义大、无空格、繁体/简体共存、新词多。但现代 LLM 用 BPE/Unigram 词表 + 大规模中文语料,已基本解决。