新智元报道 就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。 事情是这样的。 9月1日,Hugging Face上线了两个开源端侧模型: 星火X2.5-4B和1.7B 。 本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两 圈的对手,狠狠地秀了一把肌肉。 比如考验多轮工具调用的

新智元报道 Claude 5.1刚问世,另一边OpenAI Astra马上杀到。 现在,就连谷歌也有了新动作。最新爆料, Gemini 3.8 Flash将在明日登场 。 看来,AI圈又要「过年了」。 比起Gemini 3.8 Flash的发布,许多人还是更加好奇:Gemini 3.5 Pro到底什么时候来啊?! 对不起,不用等了, 谷歌已放弃…… 今年5月

新智元报道 AI黑客学会的第一件事,竟是插队? 澳大利亚开发者Andrew坐在沙发上,觉得抢健身课这件事实在太烦。 热门早课总是秒没。他每天像玩「刷新轮盘赌」,蹲点、点击、失败、再点,累得够呛不说还老抢不到。 于是,他把这件小事,甩给了自己的AI助理。 几分钟后,AI回来报喜:它找到了办法,能订到几周之后的课,远远超出系统本该允许的时间。 紧接着,它又汇报:

新智元报道 OpenAI 即将发布的模型 Astra,在内部评测中拿到了漏洞利用基准 ExploitBench 的满分,还顺手挖出了两个此前无人知晓的零日漏洞。 更夸张的是,面对一个加固浏览器,它从零开始找到多个未知漏洞,拼出一条完整的沙箱逃逸链——只要你打开一个 HTML 文件,它就能在你的电脑上执行任意命令! Astra 即将上线 ChatGPT,而 O

新智元报道 最近,人形机器人运动会可太火了。 第二届世界人形机器人运动会刚在北京「冰丝带」落幕,2056台机器人,参加了1301场比赛。 有的机器人跟世界冠军郑洁打网球;有的机器人跟奥运冠军丁宁打起了乒乓球。 亮点最多的还是百米。几位飞毛腿冲过终点线时快到「飞」出重影,得靠终点外的缓冲垫才能减速下来。 看完比赛,热血沸腾的你,也想入手一台?然后才发现,事情没
脚本语言又被称为扩建的语言,或者动态语言,是一种编程语言,用来控制软件应用程序,脚本通常以文本(如ASCII)保存,只在被调用时进行解释或编译。
Docker 是一个开源的应用容器引擎,让开发者可以打包他们的应用以及依赖包到一个可移植的镜像中,然后发布到任何流行的 Linux或Windows操作系统的机器上,也可以实现虚拟化。容器是完全使用沙箱机制,相互之间不会有任何接口。
Docker 是一个开源项目,诞生于 2013 年初,最初是 dotCloud 公司内部的一个业余项目。它基于 Google 公司推出的` Go `语言实现。项目后来加入了 Linux 基金会,遵从了 Apache 2.0 协议,项目代码在[GitHub](https://github.com/docker/docker) 上进行维护
引言:
参数初始化是训练深度神经网络的一个关键步骤,目的是给网络中权重(weights)和偏置(biases)赋予初始值。合适的参数初始化方法有助于提高训练速度、避免梯度消失/爆炸问题,并且加速网络的收敛。
避免梯度消失和梯度爆炸:在深度神经网络中,参数初始化对梯度流动非常重要。如果初始权重值太大或太小,可能导致梯度爆炸或梯度消失,从而增加网络的训练难度。加速收敛:良好的初始化可以帮助网络在训练过程中更快地收敛,减少训练时间。打破对称性:在神经网络中,如果所有的神经元参数都初始化为相同的值,那么在训练过程中,它们会在每一层的计算中产生相同的输出,导致神经元学习到相同的特征。因此,初始化时需要打破对称性,给每个神经元不同的初始值。概念:由Xavier Glorot 提出的初始化方法,适用于 Sigmoid 和 Tanh 等激活函数。权重初始化时从均匀分布或正态分布中抽取,值的范围与输入和输出的维度相关。
公式(均匀分布):
其中 和 分别是当前层和下一层的神经元个数。
特点:适用于 Sigmoid 和 Tanh 激活函数。通过调节初始化的方差,使得信号在网络中保持稳定,避免了梯度爆炸和梯度消失。
使用场景:对于使用 Sigmoid 或 Tanh 激活函数的神经网络层(特别是全连接层),是一个常用的初始化方法。
概念:由 Kaiming He 提出的初始化方法,特别适用于 ReLU 激活函数及其变种(如 Leaky ReLU)。
公式(正态分布):
其中 是当前层的神经元个数。
特点:适用于 ReLU 和其他 ReLU 类似的激活函数。相比于 Xavier 初始化,He 初始化增加了一个因子 2,确保 ReLU 在正数区域时有更大的方差,避免梯度消失。
使用场景:对于 ReLU 激活函数及其变种(如 Leaky ReLU)常用的初始化方法。
概念:LeCun 初始化特别适用于 Sigmoid 和 Tanh 激活函数,尤其是在卷积神经网络(CNN)中应用广泛。
公式(正态分布):
其中 是当前层的神经元个数。
特点:适用于 Sigmoid 和 Tanh 激活函数。适用于卷积神经网络,特别是在处理小型图像数据时。
使用场景:适用于卷积层的初始化,特别是用于 Tanh 和 Sigmoid 激活函数的情况。
概念:Orthogonal 初始化方法初始化权重矩阵为一个正交矩阵。这种方法在每一层之间保持信号的稳定传播,尤其在深度神经网络中效果显著。
特点:适用于深度神经网络的权重初始化。通过使用正交矩阵保持不同层之间的梯度传播稳定,避免梯度消失。
使用场景:适用于深度网络,特别是使用 ReLU 或其他激活函数的网络层。
| 初始化方法 | 适用激活函数 | 特征 | 使用场景 |
|---|---|---|---|
| 零初始化 | 不适用 | 所有权重初始化为0 | 主要用于偏置初始化,避免用作权重初始化 |
| 随机初始化 | 所有激活函数 | 随机选择权重,打破对称性 | 简单网络结构,但可能导致梯度爆炸/消失问题 |
| Xavier 初始化 | Sigmoid, Tanh | 根据输入输出神经元数调整权重方差 | 适用于深度网络,特别是使用 Sigmoid 或 Tanh 激活函数 |
| He 初始化 | ReLU, Leaky ReLU | 更大的方差,适用于 ReLU 等激活函数 | 适用于使用 ReLU 或其变种的深度神经网络 |
| LeCun 初始化 | Sigmoid, Tanh | 小的方差,适用于卷积神经网络 | 适用于卷积神经网络,特别是 Sigmoid 和 Tanh 激活函数 |
| Orthogonal 初始化 | 所有激活函数 | 初始化为正交矩阵,保持信号稳定传播 | 深度神经网络,特别是 ReLU 或其变种的网络 |