843 / 学习讲义

信息技术 / 11

大数据与人工智能:从数据到有边界的应用

一次解决一个小问题。从具体例子开始,理解条件,再亲手算一遍。

11 / 大数据与人工智能:从数据到有边界的应用 · 小节 1

数据处理与分布式直觉

读完这一节,你会

能画出处理流程,并解释大规模数据的质量与协调问题。

大纲要求的教学展开 · 技术讲解 · 本节来源与考点

前置知识:样本均值、样本方差与抽样分布 关系、键与关系操作 · 符号回看

从一个问题开始

十万条回收记录里有重复、缺失和不同单位,直接求平均靠谱吗?

数据流程需要质量与隔离

数据流程需要质量与隔离。步骤文字在图下。采集清洗分析/训练评价
1 / 3

先采集并统一口径;缺失不自动当0。

原创教学示意 · 手动播放,可随时暂停;折叠或离开小节时停止。

把这件事讲清楚

数据流程包括采集、校验、清洗、整合、存储、分析、呈现与反馈。ETL是抽取Extract、转换Transform、加载Load;原始记录应保留可追溯来源和变换规则。大数据不只是“大文件”,还涉及规模、速度、类型和可信度。批处理处理一批已积累数据;流处理持续处理到来的事件,需要应对乱序和重复。

分布式把存储或计算放到多节点,能扩展但增加网络、故障、复制一致性等成本。MapReduce直觉是先对局部生成键值,再按键归组汇总;不同节点局部结果必须按正确规则合并。

为什么成立 · 关键推导

先定义指标:回收重量统一kg,缺失不自动补0,同一事件按稳定ID去重。再按社区分组求总量与次数,平均=总量/次数;不能无权平均各机器算出的平均数。记录清洗前后数量,便于追查损失。

入门例题 / 1

节点A有2条,均值10;节点B有8条,均值20。总体均值=(2×10+8×20)/10=18,不是(10+20)/2=15。可合并(sum,count)而非只合并mean。

典型应用与变式 / 2

词频统计:Map对“书 书 图”输出(书,1),(书,1),(图,1);按键归组;Reduce求和得到书2、图1。若某批重复投递,需幂等或去重,否则会多算。

停一下,自己试一试

先独立作答;卡住时看提示,完成后再对照解析。

概念判断

缺失值与真实零值可直接合并吗?

需要一点提示

不知道和测得0的含义不同。

查看过程、答案与错因

不能。需记录缺失原因并制定处理策略,否则低估均值或误判没有活动。

计算与执行过程

A节点sum=12,count=3,B节点sum=18,count=2,合并平均?

需要一点提示

合并分子与分母。

查看过程、答案与错因

(12+18)/(3+2)=6。

条件与错误辨析

分布式机器数翻倍,速度一定翻倍吗?

需要一点提示

串行阶段、通信、倾斜。

查看过程、答案与错因

不一定。协调开销、热点数据、串行步骤和IO都限制收益,应测瓶颈。

带走这一句

先把数据定义和质量说清,再谈规模。

11 / 大数据与人工智能:从数据到有边界的应用 · 小节 2

机器学习任务与训练评估

读完这一节,你会

区分学习任务,设计不泄漏答案的评估。

大纲要求的教学展开 · 技术讲解 · 本节来源与考点

前置知识:数据处理与分布式直觉 · 符号回看

从一个问题开始

用过去预约记录预测是否爽约,模型看起来99%准确就足够吗?

数据流程需要质量与隔离

数据流程需要质量与隔离。步骤文字在图下。采集清洗分析/训练评价
1 / 3

先采集并统一口径;缺失不自动当0。

原创教学示意 · 手动播放,可随时暂停;折叠或离开小节时停止。

把这件事讲清楚

监督学习用带标签数据学习输入到输出:分类预测类别,回归预测数值。无监督从无标签数据发现结构,如聚类;强化学习在环境交互中通过回报学习策略,不能把所有反馈都叫强化学习。训练集拟合参数,验证集选模型与超参数,测试集用于最终独立评估。按用户或时间划分可减少相关样本泄漏。

过拟合是模型抓住训练噪声、泛化差,可通过更多有效数据、合适复杂度、正则化、早停等缓解。分类准确率=(TP+TN)/总数;精确率TP/(TP+FP),召回率TP/(TP+FN)。TP真阳性为预测正且实际正,FP误报,FN漏报,TN真阴性。分母为0时需约定指标定义。

为什么成立 · 关键推导

先定错判代价,再选指标。若爽约只有1%,全预测不爽约有99%准确,却一个高风险都找不到。训练完不能用测试结果反复调参后还称独立测试;特征中若含“最终是否归还”去预测早期是否逾期,就泄漏未来信息。

入门例题 / 1

100例中实际正10,模型找出8个正、错报12个负:TP8,FP12,FN2,TN78。准确率86%,精确率8/20=40%,召回率8/10=80%。

典型应用与变式 / 2

预测等待分钟是回归,可用平均绝对误差MAE。真实[2,5,8],预测[3,3,7],绝对误差[1,2,1],MAE=4/3分钟;不能用分类准确率衡量。

停一下,自己试一试

先独立作答;卡住时看提示,完成后再对照解析。

概念判断

训练误差越来越小,泛化一定变好吗?

需要一点提示

观察未参与拟合的数据。

查看过程、答案与错因

不一定。验证误差可能反升,提示过拟合;选择需根据独立验证表现。

计算与执行过程

TP=6,FP=4,FN=2,求精确率与召回率。

需要一点提示

分别问预测正中有多少真、实际正中找回多少。

查看过程、答案与错因

精确率6/10=0.6;召回率6/8=0.75。

条件与错误辨析

同一用户的相邻截图随机分到训练和测试会有什么风险?

需要一点提示

样本是否几乎重复?

查看过程、答案与错因

相关信息泄漏会夸大泛化能力。若目标是新用户,应按用户分组划分;目标是未来时段则考虑时间划分。

带走这一句

评估要模拟真正使用的场景,而不是让分数好看。

11 / 大数据与人工智能:从数据到有边界的应用 · 小节 3

神经网络、生成式AI与设计应用

读完这一节,你会

解释训练的基本环节,给生成工具安排可核验的职责。

大纲要求的教学展开 · 技术讲解 · 本节来源与考点

前置知识:机器学习任务与训练评估 · 符号回看

从一个问题开始

让模型生成一张展览草图和让它证明消防出口合规,是同一种可靠性要求吗?

一个神经元的前向计算

一个神经元的前向计算。步骤文字在图下。(1,3)2×1−3+1z=0
1 / 3

输入x₁=1、x₂=3,权重2、−1,偏置1。

原创教学示意 · 手动播放,可随时暂停;折叠或离开小节时停止。

把这件事讲清楚

神经网络由参数化计算层连接,简单单元计算加权和加偏置,再经非线性激活。前向计算产生预测,损失衡量与目标差异,反向传播高效计算梯度,优化器据此更新参数;梯度是改变参数时损失怎样变化的局部方向。没有非线性,多层线性映射仍可合成一个线性映射。

生成式模型学习数据模式并生成新内容,语言模型可按上下文预测后续词元,图像模型可用不同生成机制。流畅不保证真实;幻觉指貌似可信但无根据的输出。训练偏差、隐私、版权、可解释性和误用风险均需在应用中考虑。设计者须验证事实与关键约束,不能把生成数量等同于创新价值。

为什么成立 · 关键推导

完整设计流程:先由人给问题证据和约束→工具辅助多样化草案→逐项筛查可行性与来源→让目标用户试用→人工决策并记录修改。高影响判断如安全尺寸需查专业标准和实际测量,不能仅依赖生成图看起来合理。

入门例题 / 1

一个单元z=2x₁−x₂+1,输入(1,3)得到z=0;若ReLU激活max(0,z),输出0。改变输入不等于训练;训练改变的是权重与偏置。

典型应用与变式 / 2

数字展览可让AI生成三种叙事文案作为候选,人再核对每条历史事实、版权和语气;为观众提供资料出处与人工纠错入口。作品说明明确工具参与,不把虚构史料做成真实档案。

停一下,自己试一试

先独立作答;卡住时看提示,完成后再对照解析。

概念判断

神经网络层数越多就必定更适合小样本吗?

需要一点提示

容量、数据和计算约束。

查看过程、答案与错因

不一定。可能更易过拟合、训练更难,应从可验证基线开始比较。

计算与执行过程

z=x₁+2x₂−3,输入(2,0),ReLU输出?

需要一点提示

先加权,再截负值。

查看过程、答案与错因

z=−1,ReLU输出0。

条件与错误辨析

为适老服务生成看似真实的受访者语录能充当调研证据吗?

需要一点提示

生成与实际观察来源不同。

查看过程、答案与错因

不能。可明确作为假设情境帮助构思,但真实证据必须来自实际调研并按同意要求处理;不能伪造访谈。

带走这一句

把AI作为可检验的协作工具,让人承担问题定义与结果判断。

章末 / 把知识接起来

综合训练

原创综合训练

节点A有2条均值5,B有8条均值10,算合并均值。分类TP8、FP2、FN4算精确率召回率。为AI展览说明设计核验步骤。

需要一点提示

合并sum/count;指标分母不同。

查看过程、答案与错因

均值(10+80)/10=9;精确率8/10=0.8,召回率8/12=2/3。展览内容先列事实清单与来源,由人核对年代、引用和权利,保留纠错渠道;生成语句流畅不是史实证明。

一点一点,积累下来。

今日学习

00:00:00

累计学习

00:00:00

学习天数

0 天

点击“开始计时”后累计时间。同一科目内切换章节或刷新会接续;切换科目不会自动启动另一科。仅当前获得焦点的可见页面累计,离开、关闭或休眠期间不补计。两科的时间与成就分别保存。

记录保存在当前浏览器,关闭后仍保留;清除网站数据会删除记录。每天累计满 1 分钟记为一个学习日,不要求连续打卡。

学习成就

已达成 0 / 10

成就记录投入与阅读进展,不代表掌握程度。阅读类成就随已读标记更新,撤销标记后会重新计算。