首页 > GAME > 游戏 > 正文

金刚狼

苹果诉OpenAI未点名Jony Ive_我的网站

天装战队护星者

一 |     

     阿里云优惠券 先领券再下单        前面有写过一篇瀑布流的采集方法,今天在添加一个POST方法来采集Ajax刷新页面的教程。    IT之家 7 月 21 日消息,在上周末(7 月 19 日)的 Power On 时事通讯中,彭博社的马克 · 古尔曼(Mark Gurman)指出,苹果出于多方面因素考虑,在指控 OpenAI 的 41 页诉状中,并未点名前苹果公司设计师乔纳森 · 伊夫(Jony Ive)。         苹果公司于 7 月 12 日向美国加利福尼亚北区联邦地区法院提起诉讼,指控 OpenAI 及其硬件子公司 io Products 通过挖走苹果员工、获取内部文件和接触供应商等方式,盗用苹果商业秘密。    之前的文章请看:火车头采集动态加载Ajax数据(无分页瀑布流网站)    如果遇到POST方法来架子Ajax数据,这和我之前写的是两个类型,瀑布流是直接刷新出数据的页面。    采集网站分析    采集任何一个新站前我们都要对他进行一番分析才好下手。    列表页分析    这个网站的列表页,前面并不是通过Ajax加载的。         IT之家援引博文介绍,在诉讼文件中,苹果公司将矛头对准了以下几人:          Tang Tan:指控其在苹果任职期间(前 iPhone 产品设计副总裁)提前泄露供应商信息及机密,离职后诱导应聘者携带原型机、CAD 图纸等加入 OpenAI,并系统性转移供应链资源。CTRL+U可以直接看到列表内容,通过浏览器也看不到相关请求地址。    

    因为习惯原因,我直接看了下尾页列表页。

二 |     Chang Liu:指控其在职期间指导现任苹果同事规避安全审查复制机密文件,面试前传授未发布项目复习要点,并建议改用私人通讯工具(如 LINE)进行违规交流。

三 |     Yu-Ting “Alyssa” Peng:在仍任职苹果期间,持续向已跳槽至 OpenAI 的刘畅泄露苹果内部保密硬件项目的核心信息,包括项目进展、供应商决策、工程细节等关键保密内容          古尔曼认为,苹果在诉状中未点名伊夫,其中最主要的原因是苹果公司认为关联性有限。伊夫通过设计公司 LoveFrom 参与 OpenAI 硬件项目,但不负责招聘,也不处理日常运营。然后顺手CTRL+U看看网站代码结构有没有大的变化。防止后期采集出错。

四 | 结果就发现无法看到列表内容。浏览器可以看到一个通过post请求的地址。

五 |     

    这时候就意识到这网站列表页可能后面的应该全是通过Ajax加载的。         第二个原因是伊夫和乔布斯遗孀 Laurene Powell Jobs 私交甚好,古尔曼指出 Powell Jobs 曾投资于 io Products,并且仍然支持 LoveFrom。

六 |     通过笨方法,手动访问页面看看Ajax加载大概是哪些。最后找到大概从2200页左右开始Ajax加载。    那我们采集的时候,前面的列表页就可以使用普通方式去采集(速度更快)。

七 |          Powell Jobs 虽然不是苹果董事会成员,也不是公司最大股东之一,但“Jobs”这个姓氏在库比蒂诺仍具影响力。    2200页开始到尾页就通过post请求Ajax页面数据。消息称苹果公司在起诉 OpenAI 时,曾考虑是否要把伊夫写入其中,最终因为这一层关系而放弃。

八 |          第三个原因是舆论观感。

九 | 伊夫于 2019 年离开苹果,并在 2022 年前担任付费顾问。报道指出在库克执掌苹果公司后,库克更重视运营效率、制造和成本纪律,设计不再居于核心位置。         古尔曼认为如果苹果把伊夫拉入本次诉讼争议中,在法庭作证环节中,法官或者对方律师可能要求其回答对苹果设计地位变化的看法。    抓包获取Post数据    这个Ajax地址我在浏览器看不到任何跟页码有关的数据。最后只能使用抓包工具看一下详细的请求内容了。

十 |     

    使用抓包工具Fiddler    Fiddler下载地址:OneDrive-Fiddler-Setup_v5.0.20204.45441.zip    安装设置完成后我们打开浏览器。重新访问一下采集页面,Fiddler会抓到很多请求地址。    查看分析Post数据    Ctrl+F 我们搜索那个Ajax地址    
火车头使用Post方法采集Ajax页面教程
    Fiddler会以黄色将搜索到的结果显示出来,我们点击一下他。    
火车头使用Post方法采集Ajax页面教程
    在Fiddler右侧会显示这个请求地址的相关详细信息。    
    信息顶部可以看到是post请求方法。    可以看到有我们请求的页码相关内容。    
    访问不同页码的页面,经过研究发现规律。    
    currentPageIndex的值和页码相关,值等于页码减一。我们访问6139页时,currentPageIndex值是6138。    这就找到了规律,我们打开火车头采集器。

十一 |     火车头采集器配置分页设置    起始网址填入Ajax请求地址    

    点“高级模式”。

十二 |     

    点“分页设置”,http请求方式“post”。    
    把我们Fiddler抓包获取的内容填进去。    
    将currentPageIndex值的内容替换成火车头采集器的“分页”标签。    
    下面填入页码。

十三 |     页面地址是从2200到6140,上面我们分析得出post请求内容的currentPageIndex值是实际页码减一。所以这里面我们填2199到6139.    

    网址获取选项设置    为了筛选出我们需要的内容,我们设置一下网址获取选项。

十四 |     打开浏览器F12开发工具,预览一下Ajax获取的内容。    

    可以看到链接的形式是    自考成考报名条件有哪些?    完整的链接地址是    https://域名/chengrenzikao/20200611152022.html    那我们就可以使用下面的规则提取地址。    
    我们测试一下网址采集。    测试网址采集    点击测试可能提示“post请求必须选择网页编码”我们在火车头其他设置中将编码选为“UTF8”即可。    
    可以看到已经正确获取到了链接。

十五 | 不放心可以复制链接实际访问一下看看是否正确。    

    注意事项    采集过程注意运行线程和请求间隔时间。教程在测试时因为开的线程较多,频率过高导致对方网站开启了防CC设置。

十六 | 拉黑了我一个服务器IP,此教程写完用了两台服务器。    我们实际采集可以只开1个线程,并设置合适的间隔时间,比如1000ms到1500ms左右。    本文来自2号站长网,转载请注明出处:https://www.zz2zz.com/331414.html

        
    

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。

Current article:http://u0fos.bomanglangsugangunxileba.cyou/ecwb/1m1i.html

Published on:11:25:15



声明:所发布的内容均来源于互联网,目的在于传递信息,但不代表本站赞同其观点及立场,版权归属原作者,如有侵权请联系删除。
穆桂英挂帅

金刚狼

咱们结婚吧