新闻书籍面试音乐工具关于我
BrownSugar
BrownSugar
  • 新闻
  • 书籍
  • 面试
  • 音乐
  • 工具
  • 关于我

精选文章

博客文章

热门文章

日历

日
一
二
三
四
五
六

文章分类

友情链接

  • Github
  • CSDN
  • Gitee
  • LeetCode
  • Stackoverflow
  • OSCHINA
  • Wolframalpha
  • 知乎
  • 菜鸟教程
  • 掘金

分享链接

联系我们

heitanghei@gmail.com


  • 用户协议
  • 版本记录
  • 隐私政策

Copyrights ©2020 ~ 2026 BrownSugar. 陕ICP备2023007690号.

精选文章

博客文章

热门文章

日历

日
一
二
三
四
五
六

文章分类

纯血国产!4B模型越级打怪,杀入万亿赛道
纯血国产!4B模型越级打怪,杀入万亿赛道
新智元2026/09/03

新智元报道 就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。 事情是这样的。 9月1日,Hugging Face上线了两个开源端侧模型: 星火X2.5-4B和1.7B 。 本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两 圈的对手,狠狠地秀了一把肌肉。 比如考验多轮工具调用的

Gemini 3.8,明日登场!
Gemini 3.8,明日登场!

新智元报道 Claude 5.1刚问世,另一边OpenAI Astra马上杀到。 现在,就连谷歌也有了新动作。最新爆料, Gemini 3.8 Flash将在明日登场 。 看来,AI圈又要「过年了」。 比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?! 对不起,不用等了, 谷歌已放弃…… 今年5月

新智元2026/09/03
AI替主人抢健身课,顺手删了陌生人的预约!太听话的AI才最可怕
AI替主人抢健身课,顺手删了陌生人的预约!太听话的AI才最可怕

新智元报道 AI黑客学会的第一件事,竟是插队? 澳大利亚开发者Andrew坐在沙发上,觉得抢健身课这件事实在太烦。 热门早课总是秒没。他每天像玩「刷新轮盘赌」,蹲点、点击、失败、再点,累得够呛不说还老抢不到。 于是,他把这件小事,甩给了自己的AI助理。 几分钟后,AI回来报喜:它找到了办法,能订到几周之后的课,远远超出系统本该允许的时间。 紧接着,它又汇报:

新智元2026/09/03
OpenAI Astra发布在即,全自动网络攻防能力已突破天际!
OpenAI Astra发布在即,全自动网络攻防能力已突破天际!

新智元报道 OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。 更夸张的是,面对一个加固浏览器,它从零开始找到多个未知漏洞,拼出一条完整的沙箱逃逸链——只要你打开一个 HTML 文件,它就能在你的电脑上执行任意命令! Astra 即将上线 ChatGPT,而 O

新智元2026/09/03
刚刚,全球首台「万元级」高性能人形机器人诞生!比Mac还便宜
刚刚,全球首台「万元级」高性能人形机器人诞生!比Mac还便宜

新智元报道 最近,人形机器人运动会可太火了。 第二届世界人形机器人运动会刚在北京「冰丝带」落幕,2056台机器人,参加了1301场比赛。 有的机器人跟世界冠军郑洁打网球;有的机器人跟奥运冠军丁宁打起了乒乓球。 亮点最多的还是百米。几位飞毛腿冲过终点线时快到「飞」出重影,得靠终点外的缓冲垫才能减速下来。 看完比赛,热血沸腾的你,也想入手一台?然后才发现,事情没

新智元2026/09/03

每日新闻

早报|小米「中折叠」官宣,跟华为发布会「撞档」/微信灰测未读聊天汇总、红包一键直达/50.98万,新一代理想MEGA上市

小米发布会定档 9 月 7 日,与华为、苹果「撞档」 小米官宣,将于 9 月 7 日 19:00 举行秋季旗舰新品发布会,澎程 N70 Pro、N70 Max 和 N90 Max 三款汽车将在当晚正式上市。 同场发布的还有小米 18 Fold 折叠屏手机和小米平板 9 Pro Max。两款新品都将首发搭载小米自研的玄戒 O3 AI 旗舰处理器。 值得注意的是

  • 爱范儿
  • 2026年9月3日
  • 29 分钟阅读

早报|库克卸任苹果CEO,内部告别信曝光/《牛来》密钥延期,冲刺国庆档/网易云音乐鸿蒙版开放测试

💬 库克内部告别信曝光,苹果管理层迎来新一轮调整 🧠 Codex 活跃用户增至 2500 万,OpenAI 再次重置付费用户额度 🎬 电影《牛来》密钥延期至 10 月 4 日 🏢 小米澎程 N90 Max 京沪实测 1230 公里,到达后表显还剩 54 公里 💼 小红书小范围内测「发日常」,动态 3 天后从主页隐藏 🎵 网易云音乐鸿蒙版开放测试,

  • 爱范儿
  • 2026年9月1日
  • 27 分钟阅读

博客文章

从sh到Bash再到zsh,Shell 家族图谱一张图讲清楚📊

脚本语言又被称为扩建的语言,或者动态语言,是一种编程语言,用来控制软件应用程序,脚本通常以文本(如ASCII)保存,只在被调用时进行解释或编译。

黑糖2026/06/26
从sh到Bash再到zsh,Shell 家族图谱一张图讲清楚📊
Docker+Compose从安装到使用📦一篇管够

Docker 是一个开源的应用容器引擎,让开发者可以打包他们的应用以及依赖包到一个可移植的镜像中,然后发布到任何流行的 Linux或Windows操作系统的机器上,也可以实现虚拟化。容器是完全使用沙箱机制,相互之间不会有任何接口。

黑糖2026/06/26
Docker+Compose从安装到使用📦一篇管够
Docker 装完就躺平?K8s 才是隐藏大🎮 BOSS

Docker 是一个开源项目,诞生于 2013 年初,最初是 dotCloud 公司内部的一个业余项目。它基于 Google 公司推出的` Go `语言实现。项目后来加入了 Linux 基金会,遵从了 Apache 2.0 协议,项目代码在[GitHub](https://github.com/docker/docker) 上进行维护

黑糖2026/06/26
Docker 装完就躺平?K8s 才是隐藏大🎮 BOSS

热门文章

日历

2026年9月

日
一
二
三
四
五
六

文章分类

RedisRedis
2 篇
数据安全数据安全
1 篇
人工智能人工智能
7 篇
Python
Python
2 篇
数据库数据库
2 篇
JavaJava
1 篇
NginxNginx
1 篇
电子电路电子电路
0 篇
JenkinsJenkins
2 篇
ScriptScript
1 篇
MySQLMySQL
1 篇
DockerDocker
2 篇
未分类
4 篇
神经网络之参数初始化热门文章
黑糖2026/08/24

引言:参数初始化 是训练深度神经网络的一个关键步骤,目的是给网络中权重(weights)和偏置(biases)赋予初始值。合适的参数初始化方法有助于提高训练速度、避免梯度消失/爆炸问题,并且加速网络的收敛。

一、参数初始化目的

  • 避免梯度消失和梯度爆炸:在深度神经网络中,参数初始化对梯度流动非常重要。如果初始权重值太大或太小,可能导致梯度爆炸或梯度消失,从而增加网络的训练难度。
  • 加速收敛:良好的初始化可以帮助网络在训练过程中更快地收敛,减少训练时间。
  • 打破对称性:在神经网络中,如果所有的神经元参数都初始化为相同的值,那么在训练过程中,它们会在每一层的计算中产生相同的输出,导致神经元学习到相同的特征。因此,初始化时需要打破对称性,给每个神经元不同的初始值。

二、 常见参数初始化方法

1. 零初始化 (Zero Initialization)

  • 特点:所有的权重都被初始化为 0。
  • 缺点:会导致网络中的每个神经元学到相同的特征,因为它们的输出相同。这违反了网络中神经元之间的多样性,因此不可用于权重初始化。
  • 使用场景:一般情况下不推荐使用,除非用于偏置的初始化。

2. 随机初始化 (Random Initialization)

  • 特点:权重是从一个均匀分布或正态分布中随机抽取的,避免了对称性的问题。
  • 缺点:若初始化的随机值过大或过小时,可能会导致梯度爆炸或梯度消失的问题。
  • 使用场景:适合较简单的网络结构,通常会在后续优化方法中进行改进。

3. Xavier 初始化(Glorot 初始化)

  • 概念:由Xavier Glorot 提出的初始化方法,适用于 Sigmoid 和 Tanh 等激活函数。权重初始化时从均匀分布或正态分布中抽取,值的范围与输入和输出的维度相关。

  • 公式(均匀分布):

    W∼U(−6nin+nout,6nin+nout)W \sim U\left( -\sqrt{\frac{6}{n_{\text{in}} + n_{\text{out}}}}, \sqrt{\frac{6}{n_{\text{in}} + n_{\text{out}}}} \right) W∼U(−nin​+nout​6​​,nin​+nout​6​​)

    其中 ninn_{\text{in}}nin​和 noutn_{\text{out}}nout​分别是当前层和下一层的神经元个数。

  • 特点:适用于 Sigmoid 和 Tanh 激活函数。通过调节初始化的方差,使得信号在网络中保持稳定,避免了梯度爆炸和梯度消失。

  • 使用场景:对于使用 Sigmoid 或 Tanh 激活函数的神经网络层(特别是全连接层),是一个常用的初始化方法。

4. He 初始化(Kaiming 初始化)

  • 概念:由 Kaiming He 提出的初始化方法,特别适用于 ReLU 激活函数及其变种(如 Leaky ReLU)。

  • 公式(正态分布):

    W∼N(0,2nin)W \sim \mathcal{N}\left( 0, \frac{2}{n_{\text{in}}} \right) W∼N(0,nin​2​)

    其中 ninn_{\text{in}}nin​ 是当前层的神经元个数。

  • 特点:适用于 ReLU 和其他 ReLU 类似的激活函数。相比于 Xavier 初始化,He 初始化增加了一个因子 2,确保 ReLU 在正数区域时有更大的方差,避免梯度消失。

  • 使用场景:对于 ReLU 激活函数及其变种(如 Leaky ReLU)常用的初始化方法。

5. LeCun 初始化

  • 概念:LeCun 初始化特别适用于 Sigmoid 和 Tanh 激活函数,尤其是在卷积神经网络(CNN)中应用广泛。

  • 公式(正态分布):

    W∼N(0,1nin)W \sim \mathcal{N}(0, \frac{1}{n_{\text{in}}}) W∼N(0,nin​1​)

    其中ninn_{\text{in}}nin​ 是当前层的神经元个数。

  • 特点:适用于 Sigmoid 和 Tanh 激活函数。适用于卷积神经网络,特别是在处理小型图像数据时。

  • 使用场景:适用于卷积层的初始化,特别是用于 Tanh 和 Sigmoid 激活函数的情况。

6. Orthogonal 初始化

  • 概念:Orthogonal 初始化方法初始化权重矩阵为一个正交矩阵。这种方法在每一层之间保持信号的稳定传播,尤其在深度神经网络中效果显著。

  • 特点:适用于深度神经网络的权重初始化。通过使用正交矩阵保持不同层之间的梯度传播稳定,避免梯度消失。

  • 使用场景:适用于深度网络,特别是使用 ReLU 或其他激活函数的网络层。

三、总结

初始化方法 适用激活函数 特征 使用场景
零初始化 不适用 所有权重初始化为0 主要用于偏置初始化,避免用作权重初始化
随机初始化 所有激活函数 随机选择权重,打破对称性 简单网络结构,但可能导致梯度爆炸/消失问题
Xavier 初始化 Sigmoid, Tanh 根据输入输出神经元数调整权重方差 适用于深度网络,特别是使用 Sigmoid 或 Tanh 激活函数
He 初始化 ReLU, Leaky ReLU 更大的方差,适用于 ReLU 等激活函数 适用于使用 ReLU 或其变种的深度神经网络
LeCun 初始化 Sigmoid, Tanh 小的方差,适用于卷积神经网络 适用于卷积神经网络,特别是 Sigmoid 和 Tanh 激活函数
Orthogonal 初始化 所有激活函数 初始化为正交矩阵,保持信号稳定传播 深度神经网络,特别是 ReLU 或其变种的网络
  • Xavier 和 LeCun 初始化:适用于使用 Sigmoid 或 Tanh 激活函数的网络,帮助防止梯度消失问题。
  • He 初始化:适用于 ReLU 激活函数,特别是在深度神经网络中,能有效防止梯度消失。
  • LeCun 初始化:适用于卷积神经网络,尤其是在图像处理中。
  • Orthogonal 初始化:适用于深层网络,保持信号的稳定传播,适用于 ReLU 激活函数。