11 / 大数据与人工智能:从数据到有边界的应用 · 小节 1
数据处理与分布式直觉
能画出处理流程,并解释大规模数据的质量与协调问题。
大纲要求的教学展开 · 技术讲解 · 本节来源与考点
前置知识:样本均值、样本方差与抽样分布 关系、键与关系操作 · 符号回看
从一个问题开始
十万条回收记录里有重复、缺失和不同单位,直接求平均靠谱吗?
数据流程需要质量与隔离
先采集并统一口径;缺失不自动当0。
去重、校验单位与来源,记录变换。
训练与测试分开;评价应贴近真实使用情境。
原创教学示意 · 手动播放,可随时暂停;折叠或离开小节时停止。
把这件事讲清楚
数据流程包括采集、校验、清洗、整合、存储、分析、呈现与反馈。ETL是抽取Extract、转换Transform、加载Load;原始记录应保留可追溯来源和变换规则。大数据不只是“大文件”,还涉及规模、速度、类型和可信度。批处理处理一批已积累数据;流处理持续处理到来的事件,需要应对乱序和重复。
分布式把存储或计算放到多节点,能扩展但增加网络、故障、复制一致性等成本。MapReduce直觉是先对局部生成键值,再按键归组汇总;不同节点局部结果必须按正确规则合并。
为什么成立 · 关键推导
先定义指标:回收重量统一kg,缺失不自动补0,同一事件按稳定ID去重。再按社区分组求总量与次数,平均=总量/次数;不能无权平均各机器算出的平均数。记录清洗前后数量,便于追查损失。
入门例题 / 1
节点A有2条,均值10;节点B有8条,均值20。总体均值=(2×10+8×20)/10=18,不是(10+20)/2=15。可合并(sum,count)而非只合并mean。
典型应用与变式 / 2
词频统计:Map对“书 书 图”输出(书,1),(书,1),(图,1);按键归组;Reduce求和得到书2、图1。若某批重复投递,需幂等或去重,否则会多算。
停一下,自己试一试
先独立作答;卡住时看提示,完成后再对照解析。
概念判断
缺失值与真实零值可直接合并吗?
需要一点提示
不知道和测得0的含义不同。
查看过程、答案与错因
不能。需记录缺失原因并制定处理策略,否则低估均值或误判没有活动。
计算与执行过程
A节点sum=12,count=3,B节点sum=18,count=2,合并平均?
需要一点提示
合并分子与分母。
查看过程、答案与错因
(12+18)/(3+2)=6。
条件与错误辨析
分布式机器数翻倍,速度一定翻倍吗?
需要一点提示
串行阶段、通信、倾斜。
查看过程、答案与错因
不一定。协调开销、热点数据、串行步骤和IO都限制收益,应测瓶颈。
带走这一句
先把数据定义和质量说清,再谈规模。
11 / 大数据与人工智能:从数据到有边界的应用 · 小节 2
机器学习任务与训练评估
区分学习任务,设计不泄漏答案的评估。
大纲要求的教学展开 · 技术讲解 · 本节来源与考点
前置知识:数据处理与分布式直觉 · 符号回看
从一个问题开始
用过去预约记录预测是否爽约,模型看起来99%准确就足够吗?
数据流程需要质量与隔离
先采集并统一口径;缺失不自动当0。
去重、校验单位与来源,记录变换。
训练与测试分开;评价应贴近真实使用情境。
原创教学示意 · 手动播放,可随时暂停;折叠或离开小节时停止。
把这件事讲清楚
监督学习用带标签数据学习输入到输出:分类预测类别,回归预测数值。无监督从无标签数据发现结构,如聚类;强化学习在环境交互中通过回报学习策略,不能把所有反馈都叫强化学习。训练集拟合参数,验证集选模型与超参数,测试集用于最终独立评估。按用户或时间划分可减少相关样本泄漏。
过拟合是模型抓住训练噪声、泛化差,可通过更多有效数据、合适复杂度、正则化、早停等缓解。分类准确率=(TP+TN)/总数;精确率TP/(TP+FP),召回率TP/(TP+FN)。TP真阳性为预测正且实际正,FP误报,FN漏报,TN真阴性。分母为0时需约定指标定义。
为什么成立 · 关键推导
先定错判代价,再选指标。若爽约只有1%,全预测不爽约有99%准确,却一个高风险都找不到。训练完不能用测试结果反复调参后还称独立测试;特征中若含“最终是否归还”去预测早期是否逾期,就泄漏未来信息。
入门例题 / 1
100例中实际正10,模型找出8个正、错报12个负:TP8,FP12,FN2,TN78。准确率86%,精确率8/20=40%,召回率8/10=80%。
典型应用与变式 / 2
预测等待分钟是回归,可用平均绝对误差MAE。真实[2,5,8],预测[3,3,7],绝对误差[1,2,1],MAE=4/3分钟;不能用分类准确率衡量。
停一下,自己试一试
先独立作答;卡住时看提示,完成后再对照解析。
概念判断
训练误差越来越小,泛化一定变好吗?
需要一点提示
观察未参与拟合的数据。
查看过程、答案与错因
不一定。验证误差可能反升,提示过拟合;选择需根据独立验证表现。
计算与执行过程
TP=6,FP=4,FN=2,求精确率与召回率。
需要一点提示
分别问预测正中有多少真、实际正中找回多少。
查看过程、答案与错因
精确率6/10=0.6;召回率6/8=0.75。
条件与错误辨析
同一用户的相邻截图随机分到训练和测试会有什么风险?
需要一点提示
样本是否几乎重复?
查看过程、答案与错因
相关信息泄漏会夸大泛化能力。若目标是新用户,应按用户分组划分;目标是未来时段则考虑时间划分。
带走这一句
评估要模拟真正使用的场景,而不是让分数好看。
11 / 大数据与人工智能:从数据到有边界的应用 · 小节 3
神经网络、生成式AI与设计应用
解释训练的基本环节,给生成工具安排可核验的职责。
大纲要求的教学展开 · 技术讲解 · 本节来源与考点
前置知识:机器学习任务与训练评估 · 符号回看
从一个问题开始
让模型生成一张展览草图和让它证明消防出口合规,是同一种可靠性要求吗?
一个神经元的前向计算
输入x₁=1、x₂=3,权重2、−1,偏置1。
ReLU取max(0,z),输出0。
训练时根据损失调整参数;本图仅演示前向计算。
原创教学示意 · 手动播放,可随时暂停;折叠或离开小节时停止。
把这件事讲清楚
神经网络由参数化计算层连接,简单单元计算加权和加偏置,再经非线性激活。前向计算产生预测,损失衡量与目标差异,反向传播高效计算梯度,优化器据此更新参数;梯度是改变参数时损失怎样变化的局部方向。没有非线性,多层线性映射仍可合成一个线性映射。
生成式模型学习数据模式并生成新内容,语言模型可按上下文预测后续词元,图像模型可用不同生成机制。流畅不保证真实;幻觉指貌似可信但无根据的输出。训练偏差、隐私、版权、可解释性和误用风险均需在应用中考虑。设计者须验证事实与关键约束,不能把生成数量等同于创新价值。
为什么成立 · 关键推导
完整设计流程:先由人给问题证据和约束→工具辅助多样化草案→逐项筛查可行性与来源→让目标用户试用→人工决策并记录修改。高影响判断如安全尺寸需查专业标准和实际测量,不能仅依赖生成图看起来合理。
入门例题 / 1
一个单元z=2x₁−x₂+1,输入(1,3)得到z=0;若ReLU激活max(0,z),输出0。改变输入不等于训练;训练改变的是权重与偏置。
典型应用与变式 / 2
数字展览可让AI生成三种叙事文案作为候选,人再核对每条历史事实、版权和语气;为观众提供资料出处与人工纠错入口。作品说明明确工具参与,不把虚构史料做成真实档案。
停一下,自己试一试
先独立作答;卡住时看提示,完成后再对照解析。
概念判断
神经网络层数越多就必定更适合小样本吗?
需要一点提示
容量、数据和计算约束。
查看过程、答案与错因
不一定。可能更易过拟合、训练更难,应从可验证基线开始比较。
计算与执行过程
z=x₁+2x₂−3,输入(2,0),ReLU输出?
需要一点提示
先加权,再截负值。
查看过程、答案与错因
z=−1,ReLU输出0。
条件与错误辨析
为适老服务生成看似真实的受访者语录能充当调研证据吗?
需要一点提示
生成与实际观察来源不同。
查看过程、答案与错因
不能。可明确作为假设情境帮助构思,但真实证据必须来自实际调研并按同意要求处理;不能伪造访谈。
带走这一句
把AI作为可检验的协作工具,让人承担问题定义与结果判断。
章末 / 把知识接起来
综合训练
原创综合训练
节点A有2条均值5,B有8条均值10,算合并均值。分类TP8、FP2、FN4算精确率召回率。为AI展览说明设计核验步骤。
需要一点提示
合并sum/count;指标分母不同。
查看过程、答案与错因
均值(10+80)/10=9;精确率8/10=0.8,召回率8/12=2/3。展览内容先列事实清单与来源,由人核对年代、引用和权利,保留纠错渠道;生成语句流畅不是史实证明。