计算机的时钟速率最终决定了顺序操作或指令之间的最短时间间隔。尽管由于摩尔定律和日益并行的系统架构,电子计算机性能呈指数级增长,但传统处理器的时钟速率在近二十年来一直停滞在约5 GHz。这对需要实时处理或控制超快信息系统的应用构成了重大挑战。在此,我们通过提出并实验演示一种基于全光循环神经网络的计算来打破这一障碍,该网络利用线性和非线性光学操作的超快特性,同时绕开电子瓶颈。全光计算机完全在光学域中实现线性操作、非线性函数和存储,在高达80 GHz的时钟速率下,其精度根据任务的不同超过纯线性模型。我们实验演示了噪声波形分类这一原型任务,并对集成光学微谐振器的孤子态进行了超快原位分析。我们还进一步展示了该架构在基于量子涨落的生成式人工智能中的应用,即使在无输入光学信号的情况下也能生成图像。我们的结果突显了全光计算通过利用超快线性、非线性和存储功能以及量子涨落,在超越数字电子学所能达到的潜力。SOI晶圆:--340nm/500nm/400nm/220nm薄膜/ 3um厚膜-3umSIO2-675umALOOI晶圆;--氧化铝薄膜晶圆,键合工艺和镀膜工艺
AlGaAsOi --mbe+外延转移+光量子
InGaPoi--mbe+外延转移+光量子
ALN EPI:氮化铝外延片--用于紫外非线性光学
TAOOI晶圆--氧化钽薄膜晶圆,IBS镀膜工艺
SINOI晶圆--超低损耗氮化硅薄膜晶圆,210nm-300nm-400nm-800nm
SICOI晶圆:新型量子光学平台500nm-700nm-1um
8寸LTOI晶圆批量供应;铌酸锂的有力的竞争对手,薄膜钽酸锂晶300600
6寸X切Z切掺镁薄膜铌酸锂晶圆 ,厚膜 3um 5um 和 薄膜 100-600nm
8寸LNOI晶圆;8寸LNOI助力更大规模薄膜铌酸锂产品量产
我们为客户提供晶圆(硅晶圆,玻璃晶圆,SOI晶圆,GaAs,蓝宝石,碳化硅(导电,非绝缘),Ga2O3,金刚石,GaN(外延片/衬底)),镀膜(PVD,cvd,Ald,PLD)和材料(Au Cu Ag Pt Al Cr Ti Ni Sio2 Tio2 Ti3O5,Ta2O5,ZrO2,TiN,ALN,ZnO,HfO2。。更多材料),键合(石英石英键合,蓝宝石蓝宝石键合)光刻,高精度掩模版,外延,掺杂,电子束光刻等产品及加工服务(请找小编领取我们晶圆标品库存列表,为您的科学实验加速。
请联系小编免费获取原文
文章名:All-optical computing towards 100-GHz clock rates作者:Gordon H. Y. Li1,MidyaParto2,3,4, JinhaoGe5,Qing-XinJi5, Maodong Gao3,5,YanYu5, James Williams2,Robert M. Gray2,Christian R. Leefmans1, Nicolas Englebert2,KerryJ.Vahala5and Alireza Marandi 1,21.Department of Applied Physics, California Institute of Technology, Pasadena 91125 CA, USA 2.Department of Electrical Engineering, California Institute of Technology, Pasadena 91125 CA, USA时钟速率最终决定了计算机中顺序操作或指令之间的最短时间[1],因为计算机无法在短于单个时钟周期的时间尺度上有效处理信息或响应输入信号。计算机硬件的演变以许多重大技术转变为特征:从早期机械计算机(如时钟速率为1 Hz的Z1[2])开始,然后发展到由真空管构成的通用电子计算机(如时钟速率为100 kHz的ENIAC[3]),最终成熟为今天由数十亿集成硅晶体管构成的具有GHz时钟速率的中央处理单元(CPU)[1]。历史上,时钟速率的每一次急剧提升都使许多以前在计算上不可行的新应用和创新成为可能。如图1所示,现代CPU时钟速率自2005年左右以来一直停滞在约5 GHz。在2005年之前,CPU时钟速率与摩尔定律[4]同步增长。这种突变主要源于器件层面晶体管登纳德缩放比例[5]的失效,以及系统层面冯·诺依曼瓶颈[6]的日益普遍,这促使CPU设计者放弃进一步大幅提高时钟速率。因此,近年来的性能改进主要归功于多核和其他高度并行计算机架构的引入,这些架构提高了整体计算吞吐量。虽然时钟速率不是不同系列计算机处理器之间绝对计算速度的直接可比度量,因为每个时钟周期内的指令集和操作可能不同,但电子计算机有限的时钟速率阻止了在皮秒或更快时间尺度上对新兴超快信息系统进行实时处理或控制,这一点仍然是明确的。这突显了光学计算的一个独特机遇,特别是当所有计算操作(即线性和非线性函数以及存储)都在光学域中实现时。以可扩展和可编程的方式实现这样的全光计算平台已被证明具有挑战性,尤其是因为非线性函数和全光存储的限制[7]。图1 过去29年CPU时钟速率。每个点表示一种不同类型的商用CPU的时钟速率和测试日期。颜色对应于设计该CPU的实体,图例中列出了一些著名的CPU设计者。底部的红色圆圈和文字插图表示日益先进的半导体工艺节点及其大致引入时间。在2005年之前,时钟速率呈指数增长并与摩尔定律同步。然而,自2005年以来,时钟速率已停滞不前,仅呈增量式增长。光学计算机近年来经历了复兴,作为深度学习[14-16]、神经形态计算[17-21]和组合优化[22-24]工作负载中线性和非线性操作[8-13]的专用硬件。然而,先前的方法主要优先考虑能效、高吞吐量或并行处理,并且仍然依赖数字处理器或光电子学进行中间计算步骤,因此最终受到电子响应时间的瓶颈限制。此外,先前的几种全光方法[22,25-29]存在以下一个或多个问题:(i) 缺乏关键操作,如非线性和/或存储,(ii) 缺乏可编程性,以及 (iii) 利用慢速非线性效应。一个能够超过当前电子计算机时钟速率的全光可编程计算机尚付阙如。在本工作中,我们通过结合用于非线性操作的超快非线性光学、用于线性操作的干涉和用于光学存储的有源腔,提出并实验演示了超越电子计算机限制的高时钟速率全光计算。超快非线性光学相对于先前方法提供了两个独特优势:(i) 参量χ⁽²⁾光学非线性的近瞬时响应时间比电子非线性快几个数量级,以及(ii) 产生超短激光脉冲的能力,这使得与电子学或连续波光相比,能够进行时间复用和更高的单通道数据编码速率。我们提供了几个计算任务的实验示例,包括噪声波形分类、原生超快光学输入信号的原位处理、时间序列预测以及从量子噪声播种的全光学图像生成。我们的光学计算机架构采用循环神经网络(RNN)框架,如图2a所示。RNN包含输入层、隐藏循环层和输出层[30]。与纯前馈架构不同,这种受驱动动力系统非常适合时间或序列信息处理,因为循环神经元状态在连续时间步之间传播,赋予了固有的记忆。我们还注意到RNN是图灵完备的[31]。与数字或冯·诺依曼计算机架构相比,RNN架构更自然地适用于超快光学,因为它本质上是模拟的,并利用动态记忆而非非易失性存储元件。我们使用市售光纤组件构建了全光循环神经网络(AO-RNN)的实验概念验证,工作波长为λ ≈ 1.55 µm,如图2b所示。AO-RNN基于时间复用光子网络[22,32,33],其中信息和输入数据序列{s_t}被编码到超短激光脉冲的相干振幅上。因此,AO-RNN的有效时钟速率等效于激光脉冲重复频率f_c。我们利用不同类型的光学频率梳[34],包括锁模激光器、电光频率梳和光学微梳,为不同任务生成输入信号。时间步之间的循环连接使用有源光学腔实现,该腔充当光学反馈回路。光学腔还包含腔内线性耦合,使用多臂Mach-Zehnder干涉仪实现,其中耦合权重通过每臂中的电光幅度调制器进行编码。循环层的具体网络拓扑由每臂中光学延迟线的长度决定,因此时间延迟T_m应为时钟周期1/f_c的整数倍。在线非线性激活函数使用反向质子交换周期性极化铌酸锂(PPLN)波导[35]执行。PPLN实现了强χ⁽²⁾非线性光学过程,如低脉冲能量下泵浦耗尽的二次谐波产生,这导致基频谐波处脉冲幅度的类S型输入输出函数[36]。最后,线性输出层使用另一个多臂Mach-Zehnder干涉仪执行,其权重由电光调制器编码,连接由时间延迟线确定。因此,AO-RNN是一个全模拟光学计算机,它接受超快光学输入,并完全在光学域中通过线性操作、非线性激活和记忆反馈的组合产生光学输出。图2 全光计算机架构。a 一般循环神经网络(RNN)由输入层、具有循环连接的隐藏层和输出层组成。b 基于时间复用光子网络的全光循环神经网络(AO-RNN)架构示意图,其中(c)超快光学输入经过光学反馈和循环连接、非线性光学激活和线性光学操作,以产生光学输出。图3 全光噪声波形分类。a 被噪声污染的锯齿波、三角波、方波和正弦波的时间序列由AO-RNN进行分类。b 测量的分类准确率(蓝点)通常随着时钟速率f_c的增加而降低。底部水平虚线对应25%的随机猜测准确率,上部水平虚线对应纯线性模型的准确率,垂直虚线表示数字电子计算机可达到的最大时钟速率。因此,在右上区域实现了非线性光学计算优势。c f_c = 10 GHz、d f_c = 50 GHz和e f_c = 100 GHz时钟速率下显示了(按列归一化的)混淆矩阵。为了评估实验AO-RNN可达到的最大时钟速率f_c,我们训练了它(见材料与方法)来执行噪声波形分类这一原型任务。我们考虑了四类时间波形:锯齿波、三角波、方波和正弦波。这些波形具有相同的周期和持续时间,但也受到一些随机噪声的污染,如图3a所示。波形样本作为单通道输入依次馈入AO-RNN,任务是将每个波形分类到正确的类别中。因此,该任务本质上是单线程的,不一定能通过并行处理加速。AO-RNN为每个光学输入脉冲产生一个单通道光学输出脉冲。为了分配单个类别标签以进行验证,输出脉冲被光电探测,这实际上起到了低通滤波器的作用,执行时间全局平均池化。平均光学输出与数字后处理中的阈值决策边界(材料与方法)进行比较,以分配最终类别标签。或者,如果有多个输出通道可用,也可以应用常规的softmax分类。值得注意的是,类别标签分配所需的数字后处理仅在波形序列的整个持续时间之后发生,因此它只需要以比AO-RNN时钟速率f_c低得多的速率执行,并且不会成为计算的瓶颈。原则上,包含分类结果信息的输出光学脉冲如果需要,可以用作第二光学计算机级的输入以进行进一步的光学处理。如图3b所示,AO-RNN的分类准确率通常随着时钟速率f_c的增加而降低。它在f_c = 10 GHz的时钟速率下达到了97.5%的峰值分类准确率(图3c),超过了商用CPU的时钟速率。当f_c = 50 GHz时,分类准确率降至92%(图3d),因为AO-RNN开始混淆一些正弦波/三角波。当f_c = 100 GHz时,分类准确率进一步降至58%(图3e),因为AO-RNN还会混淆方波/正弦波以及三角波/锯齿波。即使在测试的最大时钟速率f_c = 120 GHz下,AO-RNN仍实现了显著高于随机猜测的分类准确率。使用纯线性模型(即无非线性激活函数)在f_c = 10 GHz下重复相同任务仅达到62%的分类准确率,这证实了PPLN光学非线性对于实现高分类准确率的重要性。AO-RNN在高达f_c = 80 GHz的时钟速率下其准确率超过了线性模型的准确率。我们将一个既具有高于任何电子CPU的时钟速率、又具有高于线性模型的分类准确率的AO-RNN定义为在高时钟速率计算应用中展现出“非线性光学优势”。图4 微梳二分孤子态分类。a Si₃N₄集成耦合微谐振器的显微图(白色比例尺:1 mm)。b 具有单、双或三脉冲对的二分亮孤子态。c 不同AO-RNN处理时间下孤子态的分类准确率。插图:处理时间为100 ns时的混淆矩阵。d 处理时间为100 ns时测量光学输出平均值的直方图和决策边界。我们已经确定了随着时钟速率f_c增加导致分类准确率下降的几个因素。首先,出于测试目的,我们使用光学时间交错技术电光生成了输入信号(补充信息第V节),随着f_c的增加,这变得越来越困难。AO-RNN依赖于相干干涉来执行线性操作和记忆反馈,因此相干激光脉冲的相对相位和时间间隔至关重要。因此,计算保真度随着输入信号中相位噪声和定时抖动的增加而降低。其次,虽然χ⁽²⁾光学非线性是超快且近瞬时的,但PPLN具有有限的相位匹配带宽约100 GHz。因此,当f_c超过相位匹配带宽时,非线性激活函数的有效性以及分类准确率开始下降。最后,当时钟周期1/f_c与脉冲持续时间相当时,相邻脉冲开始时间重叠并经历不期望的串扰。当输入数据原生在光学域中时,这些限制中的许多可以被规避,因为不需要电光或光电子转换来生成输入信号。幸运的是,超快光学研究中充满了具有高度相干性且发生在电子计算机实时处理或控制时间尺度过快的光学信号的例子。在此,我们提出AO-RNN作为超快光学的分析原位工具,这可能使使用现有实验技术不可行的新功能成为可能。图5 时间波形预测。对目标(虚线)(a) 三角波和 (b) 正弦波输入时间序列的预测(点)一步超前值。例如,图4a显示了超低损耗Si₃N₄集成耦合微谐振器[37]。这种配置可以通过χ⁽³⁾光学非线性和色散的平衡作为光学频率梳或“微梳”运行,产生二分亮孤子态。微梳因其在广泛应用中(包括光学计算、激光雷达、双梳光谱学、低噪声微波合成、光学计量和天文梳[9,10,38])的技术重要性而引起了极大的研究兴趣。Si₃N₄微梳可以产生不同的孤子态,包括单孤子脉冲对、双孤子脉冲对或三孤子脉冲对(补充信息图S6)。时域中的输出光学信号是由亚皮秒脉冲组成的周期波形,重复频率为f_c ≈ 19.97 GHz,如图4b所示。我们考虑在光学波形具有相同平均功率、重复频率、中心波长、偏振和光谱带宽的情况下分类二分孤子态(单、双或三)的任务。由于光学波形对于直接光电探测来说太快,实时执行这一任务具有挑战性。此外,采用光谱仪或自相关的常规光学测量技术通常需要毫秒或更慢时间尺度的扫描元件。其他超快表征方法,如时间拉伸[39-41],在处理区分二分孤子态所需的高重复频率和高占空比的组合时存在困难。现有的单次[42]或少次[43]方法受限于低帧更新速率和/或需要大量后处理算法来提取有用信息。此外,我们的全光学计算架构可以实现为用于控制孤子态产生和/或基于类似孤子动力学的超快传感方案的反馈机制[44]。AO-RNN可以根据输入光学波形的长度(如图4c所示)以不同的处理时间对二分孤子态进行分类。最终类别标签的分配方式与噪声波形分类相同。AO-RNN在短于100 ns的处理时间内实现了95.6%的高分类准确率。最小处理时间或延迟受限于AO-RNN中主腔往返光传播时间,约为24 ns。我们观察到需要多次腔往返才能确保高分类准确率。这种延迟是使用相对较长的光纤组件/连接器的结果,可以通过直接熔接或改用具有亚纳秒往返时间的相应集成光子平台来大幅减少。因此,有可能将AO-RNN用作光学孤子态近实时和少次分类的原位工具,这可以实现更快的测量和反馈控制环路。前两个示例任务是分类任务。我们证明AO-RNN还可以以高时钟速率执行回归任务,如时间序列预测。更快的回归能力对于许多应用中的实时决策至关重要,包括量化金融[45]、实验粒子物理[46]和光学信号处理[47]。在此任务中,时间序列的样本被编码到光学脉冲的相干振幅上,并一次一个地输入AO-RNN。任务是给定当前输入值和过去输入值,预测时间序列中的下一个值。相应的输出脉冲应具有代表下一个时间步样本预测值的振幅。我们在图5中展示了三角波和正弦波时间序列预测的两个示例。AO-RNN预测与这些简单波形的目标值非常接近,在时钟速率高达f_c = 10 GHz时,归一化均方误差(NMSE)分别低至0.0144和0.0094。与分类任务(其中输出测量的速度可以在时间序列的整个持续时间内分摊)不同,回归任务需要单次且快速的输出测量。在这种情况下,我们测试和验证输出预测的能力受到光电探测器最大带宽(约25 GHz)的限制。尽管如噪声波形分类任务所证明的,AO-RNN可以以高得多的时钟速率运行,但我们在实验上受限于在f_c = 10 GHz的时钟速率以上准确测量实时脉冲到脉冲输出值。这可以通过使用更快的光电探测器(高达约100 GHz)和更好的数据采集工具或光学时分解复用方案[48]来改善。然而,这不是AO-RNN的基本限制,而是我们当前输出测量技术的约束。如果输出保持在光学域中就足够了,那么时钟速率可以高得多,因为光学输出原则上可以直接用作另一台光学计算机或执行器的光学输入。图6 量子全光学图像生成。a 全光学图像生成器利用高度非平衡激光腔动力学,将来自自发辐射的量子噪声分布映射到MNIST手写数字的未知目标图像分布。b 每10次腔往返后的示例图像,以及c 测量到的腔输出时间迹线,直到T = 100次往返,代表生成的七的训练样本。最后,我们演示了一个生成任务的示例,其中AO-RNN可以使用量子涨落作为种子,在没有任何输入光学信号的情况下生成图像[49,50]。生成模型的核心问题是学习一个复杂未知目标分布(从中可以获得样本,如图像),然后使用该模型从目标分布中高效生成新样本。我们从基于扩散[51]和基于流[52]模型的最新进展中汲取灵感。在这种情况下,一个简单的已知分布(通常是标准高斯分布)被连续扰动以匹配未知的目标分布。然后,学习的映射可以应用于来自简单分布的初始随机样本,以从目标分布生成新样本。我们使用MNIST手写数字数据集[53]训练了AO-RNN,以生成类别“七”的28×28灰度图像,如图6a所示。该实现仅利用了AO-RNN的循环层。主腔包含一个光学放大器,它充当可编程增益/损耗机制。光学放大器还以自发辐射的形式提供量子噪声,自发辐射近似遵循高斯分布(补充信息图S9)。因此,AO-RNN可以被解释为一个高度非平衡激光腔。在传统激光器中,增益介质中的自发辐射充当触发受激辐射的火花,随后在超过激光阈值(即增益等于损耗)后,粒子数反转和增益钳制将导致稳态激光发射[54]。在此,我们以比腔往返时间快得多的时钟速率f_c调制增益和腔内连接权重。因此,激光动力学也是高度非平衡的。我们通过将腔虚拟分割成等间距的时间仓来定义腔模式。每个时间仓对应于图像中的不同像素位置,每个时间仓中包含的平均功率编码了像素灰度强度。在初始开启时,AO-RNN从光学放大器中的自发辐射开始,然后在T = 100次腔往返后,通过有效控制哪些腔模式暂时高于/低于激光阈值,逐渐生成宏观图像。图6b、c显示了训练过程中样品腔动力学和生成图像的示例时间迹线。训练过程后由量子噪声播种生成的新图像(即不属于原始MNIST数据集)的示例见补充信息图S10。我们注意到,我们简单的生成式AO-RNN表现出有限的模型表达能力,难以生成多个不同数字类别的高质量图像,或学习比MNIST数据集更复杂的图像分布。我们相信,从这个简单的概念验证模型中生成的七的质量和多样性是有前景的,并且可以通过纳入更具表达能力的非线性[11]或利用更复杂的混合光学学习技术[55]来实现更好的模型表达能力。此外,该任务的时钟速率受到用于更新线性操作权重的电光调制器10 GHz带宽的限制。与之前的任务不同,需要快速权重更新以实现图像生成所需的足够模型表达能力。因此,当前用于图像生成任务的AO-RNN实现严格来说是一个混合电光系统。真正的全光学方法可能涉及将AO-RNN概念与用于具有更多权重的线性操作的衍射光学神经网络相结合[26]。在AO-RNN的当前实现中,时钟速率f_c等于时间复用网络中光学脉冲的重复频率。为简单起见,这应与所需输入信号的输入数据速率匹配,例如电光信号的输入采样率或周期性超快光学系统的固有重复频率。因此,AO-RNN可达到的最大时钟速率从根本上受限于非线性激活函数的速度,因为它对每个光脉冲进行在线操作。在这种情况下,用于在线非线性激活的PPLN的速度由χ⁽²⁾非线性光学过程的相位匹配带宽决定。用于实现线性操作权重的调制器的模拟电带宽不影响使用静态权重的推理任务的计算机时钟速率f_c。然而,为了更好的模型表达能力,调制器权重可以实时更新,理想情况下与时钟速率f_c匹配。我们选择使用市售光纤组件以简化操作,但这对于最佳计算机性能来说并不理想。例如,用于基于弱导反向质子交换波导[35]的非线性激活的PPLN具有约100 GHz的相对较小相位匹配带宽。然而,我们之前使用薄膜铌酸锂(TFLN)展示了更高性能的非线性激活函数,最大允许时钟速率>13 THz[11]。此外,TFLN中展示的其他器件,如带宽>100 GHz的高速电光调制器[56]或速度>10 THz的全光开关[12],可以实现更快的实时权重更新。与时钟速率相当且完全可编程的更快权重更新速度也将改善所有执行任务中的模型表达能力。我们在噪声波形分类和使用电光输入信号的时间序列预测任务的实验中使用的最长持续时间激光脉冲宽度约为5 ps,这限制了最大允许时钟速率,因为脉冲将在时间上开始重叠并在超过约200 GHz时钟速率时遭受不期望的串扰。这个问题可以通过使用更短的激光脉冲来克服,例如使用TFLN中的非线性光学脉冲压缩[57]生成的少周期脉冲。最后,在TFLN中使用集成光学参量振荡器[58-60]实现AO-RNN中的主腔也可以大幅减少由光在网络中的传播时间给出的总延迟。因此,AO-RNN可以大大受益于使用TFLN[61]的片上集成,这为太赫兹时钟速率的全光计算提供了一条可扩展的路径。时钟速率的传统定义可能不直接适用于某些类型的异步或无时钟模拟计算机[15,62]。在此,我们更广泛地使用时钟周期的概念来表示连续计算机操作之间的最短时间。因此,这个概念仍然可以适用于无时钟处理器,因为每个非线性器件(电子、光电子、光学或其他)都有一个特征物理时间尺度。AO-RNN的关键优势在于它直接在光学域中实现所有线性操作、非线性激活和记忆反馈,因此所有操作可以同时受益于异常高的时钟速率,而计算某些部分没有电子瓶颈。在本工作中,我们专注于通过全光计算机执行单线程程序和任务的时钟速率获得优势。这使我们能够迈向目前使用电子计算机无法实现的皮秒时间尺度处理的新领域。然而,另一个重要的考虑因素是整体计算吞吐量(每秒总操作数)。在每个时钟周期内,实验AO-RNN目前最多执行8次操作(1次非线性激活和7次乘加操作)。因此,当前AO-RNN实现存在单通道时钟速率和整体计算吞吐量之间的权衡。Nakajima等人[21]的相关工作(比较见补充信息第VII节)使用具有时分和波分复用的光子储层计算机展示了44.16 TMAC/s的更高计算吞吐量。未来的工作可以将全光计算机的高时钟速率与并行光子处理技术[10,33]相结合,以实现相对于电子计算机的卓越计算吞吐量。我们注意到,AO-RNN仅在使用静态权重的推理期间执行全光计算。然而,训练过程(见材料与方法)使用了带有数字电子计算机的反馈回路来执行梯度下降。因此,它在训练期间是混合光电系统,在推理期间才是全光的。通过使用光学训练方法[63],可以实现训练和推理期间都是完全端到端的全光学系统。一个重要注意事项是,我们主要将我们的结果与传统的基于硅的CMOS计算机芯片进行了比较。在高速电子计算的背景下,也有兴趣使用更先进的材料和制备方法[64]或超导电路[65,66]在高达约50 GHz时钟速率下运行。然而,这些方法尚未扩展到简单小规模程序之外和/或需要低温冷却。相比之下,我们的AO-RNN已展示了在高速时钟速率和室温下的复杂时间信息处理。我们相信,这种超快光学计算机最有用近期应用将是那些输入信号原生在光学域中的应用,从而绕过了电光输入信号生成的需求。一些主要示例包括超快成像和光谱数据的原位分析[67,68]、高速相干电信系统的光学信号处理[47,48,69],以及使用飞秒激光的精密测距或激光雷达[70,71]。总之,我们已成功利用超快非线性光学开发了一种新型全光计算机,它可以超越现有数字电子计算机有限的时钟速率。概念验证实验结果表明,AO-RNN可以在10至80 GHz的时钟速率下有效运行,具体取决于执行的计算任务类型,与现有商用CPU约5 GHz的时钟速率相比是一个巨大的提升。本工作突显了朝着超快光学计算新领域的重大进展,使需要皮秒时间尺度实时信息处理和反馈控制的新兴应用成为可能。AO-RNN实验装置的详细示意图见补充信息图S1。在可能的情况下,我们使用了中心工作波长为λ ≈ 1.55 µm的商用保偏(PM)单模光纤组件。循环层由一个主腔组成,并包含一个双臂Mach-Zehnder干涉仪。Mach-Zehnder干涉仪两臂之间的相对时间延迟T₀决定了连接拓扑,是AO-RNN的一个超参数,需根据任务选择。为了正常运行,T₀被选择为时钟周期1/f_c的整数倍。由于难以切割/熔接光纤以精确匹配所需长度,相对延迟使用自制的自由空间延迟级进行微调。近似时间延迟通过传播单个参考激光脉冲并手动移动平台来设置。然后,通过高精度线性千分尺平台进行微调,通过观察相干干涉条纹可见度来最大化脉冲时间重叠。权重使用Mach-Zehnder干涉仪每臂中的电光幅度调制器(IXBlue MXAN-LN-10)设置。每个调制器接受恒定偏置电压输入以设置工作点,也接受高速RF电压输入以快速调制光学信号的幅度。偏置电压使用ADC/DAC(National Instruments 782258)控制,高达12 GSa/s的RF波形使用任意波形发生器(Keysight M8190A)生成。电压是AO-RNN的可学习权重参数。我们仅对噪声波形分类、光学孤子分类和时间序列预测任务训练了偏置电压。对于图像生成任务,我们将偏置点设置为“关闭”状态,并以10 GSa/s的更新率训练RF电压。主腔还包含一个光纤耦合PPLN波导[35],其输入/输出端均带有波分复用器,以分离基频谐波(λ ≈ 1.55 µm)和二次谐波(λ ≈ 0.775 µm)。二次谐波信号仅用于监测PPLN的相位匹配,不作为AO-RNN计算的一部分。PPLN的相位匹配使用加热平台和热电偶控制器(Omega CSC32)进行调节,最佳工作温度约为51.5°C。主腔中的最大平均光功率必须<100 mW,以避免对PPLN的光致损伤。在使用纯线性模型的噪声波形分类任务中,PPLN被旁路。对于图像生成任务,使用助推光学放大器(Thorlabs S9FC1004P)来设置主腔中的整体增益/损耗。对于噪声波形分类、光学孤子分类和时间序列预测任务,放大器被旁路,因为我们希望这些任务具有衰减记忆特性。对于噪声波形分类、光学孤子分类和时间序列预测任务,主腔往返光传播时间约为24 ns。对于图像生成任务,主腔往返光传播时间约为453 ns,因为我们需要更多时间仓以获得足够数量的像素来生成MNIST图像。对于图像生成任务,循环层的输出被直接检测,因为不使用输出层。对于需要输出层的其他任务,循环层的光学输出使用掺铒光纤放大器(Thorlabs EDFA100S)放大,并通过200 GHz带通滤波器滤波,以在进入输出层之前最小化放大自发辐射噪声。输出层由与循环层中结构相似的四臂Mach-Zehnder干涉仪组成。三臂编码输出层权重,第四臂用作可选的恒定光学偏置。相对延迟T₁ ≈ 0.3 ns和T₂ ≈ 1.6 ns是AO-RNN的超参数,需根据任务选择。由于可用的高速任意波形发生器通道数量有限,仅对输出层调制器训练恒定偏置电压。光学输出使用高速光电探测器(Newport 1414)检测,并在必要时存储在实时示波器(Keysight MSOV334A)上进行后处理。高速RF和光学输入使用低噪声10 MHz参考时钟同步。生成的RF和测量的光学信号之间的相对延迟使用任意波形发生器的样本标记输出进行校准。我们使用从未调制输入激光源分接的反向传播锁定参考,来执行时间延迟线的主动相位稳定。循环层和输出层各包含基于Pound-Drever-Hall方案[72]的独立反向传播光学锁定环。慢速光电探测器(Newport 2053)用于测量反向传播锁定信号。电子锁定信号输入到比例-积分-微分控制器(Red Pitaya STEMlab 125-14),输出被放大(Thorlabs MDT693B)以驱动光纤移相器(General Photonics FPS-002-L),主动稳定每个光学延迟线中的相对相位。我们使用了多种不同的光学频率梳来为实验任务生成光学输入信号。输入到AO-RNN的外部光学信号使用电光幅度调制器进行选通,该调制器偏置在关闭状态,因此信号仅在需要标记计算开始时才进入AO-RNN。对于噪声波形分类,输入波形使用高速任意波形发生器和电光幅度调制器电光生成。时钟速率f_c ∈ [250 MHz, 5 GHz]的激光源为光纤锁模激光器(MenloSystems FC1500-250-WG),时钟速率f_c ∈ [10 GHz, 120 GHz]的激光源为自制电光频率梳(补充信息第III节)。我们可以使用光学时间交错(补充信息第V节)实现高达f_c ≈ 48 GHz时钟速率的实时输入生成,并使用异步泵浦腔实现高达f_c ≈ 200 GHz时钟速率的离线(即预先准备)输入生成。每个噪声波形(锯齿波、三角波、方波和正弦波)持续时间为120个周期,总共5120个等间隔样本。所有噪声波形类别的周期相同,锯齿波/方波的占空比为1/2。理想无噪声波形的归一化幅度范围为[−1, 1],波形的测量光学噪声近似由零均值和标准差约0.158的加性高斯分布给出,如补充信息图S2所示。用于生成二分孤子态的Si₃N₄耦合光学微谐振器与参考文献[37]中的设计相同。我们通过慢速热功率计(Thorlabs PM20)监测,将所有二分孤子态输入到AO-RNN的平均光功率维持在约5.3 mW。我们通过分别测量每种状态的光谱(Yokogawa AQ6370C)、自相关(Femtochrome FR-103XL)和RF拍频(Rhode & Schwarz FSW85)仔细表征了单、双和三脉冲对,如补充信息图S4所示。用于时间序列预测任务的输入信号也以与噪声波形分类相同的方式电光生成。三角波每周期44个样本,占空比为1/2。正弦波的样本时间间隔与三角波相同,但周期加倍。其中 t ∈ N 是离散时间步(一个时间步表示一个时钟周期),h ∈ R^N 是 N 维隐藏循环层激活,s ∈ R^m 是 m 维输入序列,o ∈ R^n 是 n 维输出值,W^r ∈ R^(N×N) 是循环层权重矩阵,W^i ∈ R^(N×m) 是输入层权重矩阵,W^out ∈ R^(n×N) 是输出层权重矩阵,f_i : R → R 是 i = 1, 2, ..., N 的逐元素激活函数,k = 1, 2, ..., n。我们通过将主腔划分为包含脉冲的等间距时间仓,给出了AO-RNN的简化模型,该模型类似于参考文献[73]中提出的旋转神经元架构。隐藏循环层具有循环结构,其权重为:
其中{a_i(t)}是表示脉冲从时间仓i传播到时间仓(i+1) mod N的损耗/增益因子的权重。权重{β_j(t)}表示T^r中时间仓i_r与其他时间仓之间的腔内耦合。时间仓索引集合T^r表示腔内Mach-Zehnder干涉仪中光学延迟线的选择。在我们的实验AO-RNN中,T^r = {j_r}表示单个连接,因为我们使用了双臂Mach-Zehnder干涉仪。这种循环结构是全连接RNN模型的特例,仍然是图灵完备的,然而,在实践中可能导致某些任务模型表达能力降低。对于噪声波形分类、光学孤子分类和时间序列预测任务,我们使用恒定权重,对于图像生成任务,使用时变权重。由于实验限制,我们的AO-RNN具有单通道输入/输出,m = n = 1。在这种情况下,输入权重由W^{in} = ε e_{i_0}给出,其中e_k是第k个单位向量,i_0是耦合到输入线的时间仓索引,ε是输入耦合因子。我们将输入缩放ε视为不训练的超参数。然而,也可以采用更复杂的输入掩蔽技术,如先前时间复用光子储层计算机中所述[27,28]。输出权重由W_{1l}^{out} = γ_l(t)(若l ∈ T^{out})给出,否则为0,其中{γ_l(t)}由输出层调制器确定,T^{out}是表示输出层Mach-Zehnder干涉仪中光学延迟线选择的时间仓索引集合。对于噪声波形和光学孤子分类任务,我们还对光功率执行时间全局平均池化,以在整个长度为L的输入序列上产生单个输出值y = ⟨|o(t)|²⟩{0<t≤L},并将输出平均值{y}归一化到[0,1]范围。预测类别标签通过将y与阈值决策边界Z_q/q进行比较来分配,其中q是类别数,使得如果(y ≥ p/q) ∧ (y < (p+1)/q),则y属于类别p ∈ Z_q。或者,如果AO-RNN中的输出通道数等于类别数,则可以使用更常规的softmax分类。对于图像生成任务,仅使用循环层。输入序列可以用加性噪声项(补充信息图S9)代替,代表来自光学放大器的放大自发辐射,然后输出样本等效于从腔中的单个点采样。严格来说,非线性激光腔成为连续场分布,因此离散时间仓的概念并不明确。然而,我们基于快速输出测量采样时间τ对腔场进行离散化。然后,在每次腔往返期间,我们通过将快速输出样本粗粒化为周期为t'的较慢时间仓,为具有V个像素的图像序列中的像素v ∈ Z_V分配值p_v,使得p_v = ⟨|o(τ)|²⟩{t' ≤ τ < (v+1)t'}。每次腔往返的像素值被重新缩放到[-1,1]范围。我们使用时间仓周期t' = 0.4 ns,并对每次往返中未使用的像素应用对称零填充(约453 ns),因为MNIST图像仅包含784个像素。我们使用基于参考文献[16]中提出方法的无模型前向训练算法。对于每次训练迭代,我们执行以下步骤:1.选择一个随机方向向量Δ ∈ {+δ, −δ}^d,其中d是可训练模型参数的数量,Δ的元素从伯努利分布Δ_i ∼ B(1/2)中采样(i = 1, 2, ..., d),δ是步长。
2.将模型参数Θ ∈ R^d扰动Δ,并通过模型执行前向传播以评估损失函数L(Θ + Δ)。
3.将模型参数Θ沿相反方向−Δ扰动,并通过模型执行前向传播以评估损失函数L(Θ − Δ)。
4.按如下方式估计损失的方向导数:
5.更新模型参数:Θ ← Θ − η ∇_Δ L(Θ) Δ,其中η是学习率。
表1 实验AO-RNN任务的样本量
对于实验AO-RNN,前向传播步骤直接在光学硬件中执行,但其他训练步骤在数字计算机上执行。在测试期间,训练好的参数被固定,因此前向传播推理是全光学的。我们实验AO-RNN中的模型参数对应于电光调制器电压(直流和射频)。半波电压约为V_π ≈ 6 V,我们发现扰动步长δ = 0.02 V和学习率η = 2 × 10⁻³对于所有实验任务都足够。对于噪声波形和光学孤子分类任务,我们使用均方误差损失L = ⟨(y − z)²⟩,其中z = (2p + 1)/(2q)是真实类别标签决策边界的中点。对于时间序列预测任务,我们使用一步超前预测的均方误差损失L = ⟨[o(t) − s(t+1)]²⟩_t。对于图像生成任务中的每个训练样本,我们在每次腔往返T期间使用扩散过程生成中间目标值:其中ε ∼ N(0, I)是标准高斯噪声,z₁₀₀是来自图像数据集的理想目标,σ_T是从σ₁₀₀ = 0.001到σ₁ = 0.02线性增加的噪声方差计划表。我们对每个样本的所有往返和时间仓使用均方误差损失L = ⟨[x_T − z_T]²⟩_{t', T},其中x_T是每次往返T的测量像素值。每个任务的训练和测试样本量见表1。
CPU时钟速率
图1中的每个散点代表一种不同商用CPU的时钟速率和测试日期。数据收集自各种在线CPU基准测试来源[74,75]以及著名CPU设计者的新闻/产品发布信息。我们将具有相同架构设计但不同代次、性能等级或优化的CPU视为不同处理器。对于每个处理器,我们显示报告的最大时钟速率,包括可能的加速时钟速率。对于包含多个以不同时钟速率运行的核心的处理器,我们显示最快核心的时钟速率。我们关注的是为台式机、笔记本电脑、服务器、平板电脑、智能手机、可穿戴设备等设计的通用CPU;然而,我们排除了应用特定的硬件加速器,如图形或张量处理单元,它们通常比CPU具有低得多的时钟速率。图2b中垂直虚线使用的最大CPU时钟速率基于当前(截至2024年3月14日)CPU-Z超频世界纪录9117.75 MHz[76]。