电子商务系统中商业智能测量的知识管理
摘要
知识管理(KM)可以定义为发现、捕获、共享和应用知识以增强知识的战略影响力的一系列活动。商业智能(BI)是将数据转化为信息并进一步转化为知识的过程,应用于商业领域。电子商务(E‐Business)指任何使用互联网及相关技术的商业活动。本文介绍了知识管理在商业智能中的作用,通过解释知识共享系统在电子商务系统中显性知识与隐性知识动态转化过程中的有用性,阐明了KM在BI中的应用。四个指数和四个指标首次创新性地应用于电子商务领域,为在线商店中的网站使用率分析提供了数据分析能力。在该电子商务系统中,借助上述度量方法应用了两种技术:层次聚类分析(HAC)和产品分类算法(PCA)。
关键词 :知识管理;商业智能;电子商务;指数与度量;层次聚类;主成分分析;产品分类算法。
1 引言
随着每天的变化和进步,组织必须做好准备并了解可能的趋势和应用,以获得竞争优势(埃尔拉加尔和根迪,2013)。
E-Business指的是使用互联网及相关技术的任何业务。电子商务是指在互联网上开展业务,不仅包括买卖活动,还包括服务客户和与业务伙伴协作。它涵盖了使组织能够在其内部和外部利用基于互联网的技术和基础设施来执行日常业务流程运作的流程和工具。它适用于大小企业在电子commerce中的采购、销售、营销以及客户关系和管理服务。
知识管理(KM)是一个系统化且综合性的过程,通过个人和团队协调组织范围内的知识获取、创造、存储、共享、传播、开发和部署活动,以实现主要的组织目标(拉斯特吉,2000)。KM过程包括识别所需技能、共享知识、创造新知识以及编目当前的组织知识(梅勒,2001)。研究表明,KM是组织成功的关键因素(达文波特和普鲁萨克,1998;德索萨和阿瓦祖,2006)。
卢恩(1958)将智能定义为:“理解所呈现事实之间相互关系的能力,从而引导行动朝向期望的目标”。
商业智能(BI)由高德纳集团成员德雷思纳于1989年提出,该术语“描述了一套通过基于事实的支撑系统来改进商业决策的概念和方法”(鲍尔,2007)。
商业智能由嵌入个人、群体和组织结构中的一系列动态且连续的流程和实践组成(夏尔马和吉亚,2011)。
根据阿德尔曼等(2002),商业智能是一个涵盖广泛分析软件和解决方案的术语,用于收集、整合、分析和提供信息,旨在使企业用户能够做出更优的商业决策。
商业智能有助于理解、认识并从经验中获益(格林,2007)。
商业智能是一门新兴的学科,旨在将企业数据与文本用户生成内容(UGC)相结合,使决策者能够根据环境中感知到的趋势来分析其业务。尽管商业智能应用日益普及,但目前尚无特定且系统化的设计方法可用。
本文提出了一种利用有效的知识管理来设计和维护商业智能应用的迭代方法。
论文通过一个针对网店的电子商务案例研究完成,旨在证明采用结构化方法对项目成功具有积极影响。
本文的结构如下:第2节通过分析该领域的现有研究进行文献综述,第3节描述了本研究采用的方法以及应用于相关数据分析的技术。随后,第4节展示了在应用指数与度量、层次聚类以及产品分类算法(PCA)后得到的结果。这些针对产品的发现及其可能带来的影响对商业智能的贡献在第5节中进行了讨论。然后,论文进入第6节,其中得出了结论并确定了未来的工 作方向。
2 文献综述
2.1 知识管理
知识管理可以被定义为一种系统性方法,它提供高效的规范和流程,以促进知识的增长并为组织创造价值(拉奥,2002)。
知识管理(KM)已成为全球现代企业中最重要的趋势之一(潘迪和杜塔,2013)。知识管理的总体目标是改善组织内部对知识及潜在知识的系统化处理(海西格,2009)。组织必须不断更新知识,因此需要建立知识网络,以确保员工有机会分享知识(麦戈克和巴伦,2012)。此外,拉贝兹等人(2011)指出,已融入工作流程的知识管理过程可用于纠正功能失调的组织行为。
知识管理系统可分为以下几类:群件、文档管理系统、专家系统、语义网络、关系型和面向对象数据库、模拟工具以及人工智能(古普塔和夏尔马,2004年)。
知识管理对于保持和获得竞争优势至关重要,因为它支持更有效的知识获取与传递(博林杰和史密斯,2001年;麦金莱,2005年;奥夫西,1997年)。
古梅森(2000)指出,组织的关键任务是获取制度性知识以及社会互动过程的知识。知识管理系统可以改进企业的运营流程(阿罗拉,2002年)。知识管理工作的重点在于实现组织目标,例如提升绩效、竞争优势、创新、经验分享、整合以及组织的持续改进(桑切斯,1996)。知识管理需要将内化的隐性知识转化为显性知识以便共享,但同时这一过程也必须允许个人将从知识管理活动中获取的编码化知识进行内化并赋予其意义(塞伦科和邦提斯,2004年)。
2.2 商业智能
商业智能是收集信息的过程,即将数据转化为信息并进一步转化为商业领域知识的过程(格林,2006)。商业智能是一种有价值的核心能力,应像管理传统的劳动力、资本和原材料等因素一样进行管理(冯·克罗赫等,1998)。商业数据和信息是培育商业智能的土壤,使其具备从事推理、规划、解决问题、抽象思维、理解思想与语言以及从商业数据和信息中学习的能力(兰詹,2008)。
商业智能是一个涵盖架构、工具、数据库、应用程序、实践和方法论的总称(Turban等,2007)。组织未能充分发挥商业智能和知识管理工具在提升企业绩效方面的潜力(阿南塔穆拉和卡农戈,2005;李等,2005;梅西和蒙托亚‐韦斯,2002)。
商业智能成果通过业务流程实现,这些流程借助工具和信息系统来促进组织知识的获取、整合、共享与传播(巴特利特,1998;森西珀,1997)。商业智能用于理解企业所参与竞争的能力、竞争对手的行为及其行为的影响(内加什,2004)。
商业智能描述了对详细业务数据进行深入分析的结果,包括数据库和应用技术以及分析实践(甘加达兰和斯瓦米,2004)。从技术上看,商业智能涵盖范围更广,可能包括知识管理、企业资源规划、决策支持系统和数据挖掘(甘加达兰和斯瓦米,2004)。此外,商业智能主要旨在为高层管理者提供相关信息,以支持战略决策(布歇等人,2009)。Moss和Atre(2003)将商业智能描述为运营前台应用与运营后台应用的无缝集成。商业智能被定义为一种利用信息技术(IT)检索异构和分布式资源,并通过分析机制形成可用知识的解决方案(韦恩,2000)。此外,甘加达兰和斯瓦米(2004)将商业智能定义为一种企业架构,集成了操作性应用和决策支持应用及数据库,使商业用户能够便捷访问其业务数据,并做出准确的业务决策。成功的商业智能将业务与信息技术紧密结合,帮助企业管理和整合在商业智能方面的持续投资,分配商业智能资源,优先安排项目,并降低商业智能实施相关的风险(兰詹,2008)。
2.3 商业智能与知识管理的整合
KM在许多方面不同于BI。知识管理领域使用的大多数模型,例如用于证明个人信念趋向真理的动态人类过程中的隐性与显性知识框架(野中,1994;野中和竹内,1995),通常不以技术为导向。此外,KM处理的是非结构化信息和隐性知识,而这些都是BI无法解决的(马威克,2001)。
根据商业智能之父史蒂凡·德迪杰尔的观点,知识管理部分源于商业的“智能方法”思想。德迪杰尔认为,“智能”比知识更具描述性。“知识是静态的,智能是动态的”(马伦,2004)。
此外,BI与KM的融合愿景多种多样,关于KM是否应被视为BI的子集,或反之亦然的问题,在这两个成熟领域中仍存在争议(卡塞姆萨普,2015)。尽管KM和BI都受到研究界和实践者社区方法的影响,但KM与BI的整合方式似乎并非唯一(赫歇尔和琼斯,2005)。文献中已报道了多个BI与KM整合的模型(赫歇尔和琼斯,2005)。此外,马尔霍特拉(2004)提出了适用于常规结构化信息处理和非常规非结构化意义建构的KM与BI整合的一般模型。
3 提出的BI模块方法
所提出的方法包含五个主要阶段,即存储数据、预处理数据、指数计算和指标计算、应用层次聚类以及主成分分析和电子商务使用率评估的应用。前三个阶段基于Kazanidis等人(2009)和Valsamidis等人(2011, 2012a)中详细描述的框架,有助于从Web服务器运行Web应用所记录的数据中提取有用信息。
所提出方法的主要优势在于:
- 它使用日志文件进行网络使用率分析
- 它提出了首次在电子商务系统中使用的指数与度量
- 它以不同的方式使用了两种算法进行聚类和分类
- 它可以轻松地适应任何电子商务系统
- 它在一个用户友好的环境中可视化结果。
该方法的五个不同阶段如图1所示。在从位于Web服务器上的电子商务系统记录数据之后,对数据进行预处理,以便为数据分析做好准备。值得一提的是,该模块记录的信息通过URI与每个产品存储的页面数信息之间的一一映射来确保使用安全。
作者首次提出的指数与度量用于电子商务系统使用率的测量。
3.1 记录数据
此阶段涉及从电子商务系统中记录特定数据。数据记录模块嵌入在电子学习平台的Web服务器中,并进行记录网上商店数据库中特定的网上商店平台字段。更具体地说,正在记录以下字段:
1.
remote_host
:用户连接到网店的主机IP地址,以及通过whois请求获取的已连接IP地址的位置信息。
2.
session_id
:网页系统在用户认证时创建的会话ID。如果用户未向网店标识自身身份,则基于其远程IP地址的MD5哈希值为其分配一个随机的session_id。
3.
user_name
:已登录用户的用户名。如果用户未登录网店,则使用匿名用户名(可通过后处理分析,利用用户名从电子商店数据库中提取性别或年龄属性)。
4.
module_id
:电子商店组件的模块ID。识别出的网店模块包括:产品、new_product、offer_product、wish_productprice_reduction_product、新闻、链接、支付模块、配送模块和定价模块。
5.
request_uri
:会话ID所访问的电子商店网页。每个页面由module_id字段标识。对于产品、new_product、offer_product、wish_product模块,还通过product_id字段和cat_id字段进一步标识每个产品页面。如果是信息页面(如电子商店新闻或链接页面),则由唯一的news_id或link_id编号标识。如果是支付或配送产品模块,则分别由支付类型ID或运输类型ID标识。
6.
request_uri_duration
:用户访问特定页面的时间(以秒为单位)。
7.
session_duration
:总会话时长。
8.
user_order_id
:已完成的电子商店购物车交易的订单ID,包含交易日期。
9.
user_payment
:购物车交易费用的总金额。
10.
user_wishlist_id
:用户通过愿望清单模块添加至其愿望清单的新产品的ID。
11.
user_payment_type
:客户选择的购物车启用的支付类型。
12.
user_ship_type
:客户选择的购物车启用的配送类型。
13.
user_red_id
:用户通过降价值产品列表模块提议降价的产品链接。
14.
user_red_value
:产品降价值。
这些字段正在通过使用用Perl编程语言开发的Apache模块进行记录,这是第一步。
开发此类模块具有以下优势:
- 快速存储用户信息,因为它直接从服务器API执行,而不是通过电子商务应用程序或数据库执行
- 生成的数据与网店系统使用的特定公式无关。
3.2 数据预处理
第二阶段是数据预处理。日志文件中的数据包含噪声,例如缺失值和异常值。这些值必须经过预处理,以便为数据分析做好准备。具体而言,在此阶段会对记录的数据进行过滤,执行异常值检测并去除数值中的极端值。此步骤不由电子商务系统执行,而是在Web服务器中完成,因此可以嵌入到多种电子商务系统中。
上一步生成的日志文件经过筛选后,仅包含以下字段:
- productID,即每个product的标识符字符串;
- sessionID,即每次会话的标识符字符串;
- 页面统一资源定位符(URL),其中包含用户访问的平台各页面的请求。
3.3 指标和度量
尽管上述字段包含了有关电子商务流程的信息,但仍提出了更多的指标和比率(表1),以充分促进对产品网络使用率的评估。
| 指标/度量名称 | 指标/度量的描述 |
|---|---|
| 会话 | 用户查看每个产品的会话总数量 |
| 页面数 | 用户查看的每个产品的页面数 |
| 唯一页面 | 用户浏览的每个产品的唯一页面数 |
| 每个产品ID的唯一页面每次会话(UPPS) | 用户每次会话浏览的每个产品的唯一页面数 |
| 会话同质性 | 产品的同质性 |
| 丰富度 | 产品丰富度 |
| 失望度 | 用户在查看页面数时的失望度 |
| 产品兴趣度 | 它是失望度的补数 |
指标用于促进产品使用评估。首先,使用Perl程序计算指数Sessions、Pages、Unique pages和Unique Pages per ProductID per Session(UPPS)。然后,计算指标Enrichment、Disappointment、Interest和Homogeneity。最后,基于前述指标计算比率、平均比率和得分。
会话数量和所有用户浏览的页面数量被用于计算,结果显示许多用户访问了一些页面,但也有其他页面并不那么受欢迎。为了更准确地描述这一情况,我们定义了另一个指数,称为唯一页面,并通过指标来衡量所有用户在查看每个产品时访问的唯一页面总数。该指标对每个产品的页面仅计算一次,无论其被浏览了多少次。
由用户完成。每会话每产品的唯一页面数(UPPS)指标表示在一个会话中访问的每产品的唯一页面数量;它用于客观地计算产品活跃度。由于一些新手用户在浏览某个产品时可能会多次访问该产品的某些页面,UPPS会消除重复的页面访问,因为它仅将同一用户在一次会话中的访问计算一次。
丰富度是一种用于表达每个产品在教学材料方面“丰富程度”的指标。根据Valsamidis等人(2010a)的定义,丰富度被定义为唯一页面数与产品网页总数之比的补数。
$$
\text{Enrichment} = 1 - \frac{\text{Unique Pages}}{\text{Total Pages}}, \quad (1)
$$
其中唯一页面 ≤ 总页面数。
丰富度值的范围为[0, 1]。当用户在产品中遵循唯一路径时,该值为0;而在唯一页面最少的产品中,该值接近1。由于它衡量了用户浏览的唯一页面数量,因此反映了每个产品中包含的信息有多少传递给了最终用户,从而推断出该产品包含丰富的教学材料。
失望度是一个结合了用户会话和页面数的指标,用于衡量用户对产品的失望程度,即当用户浏览的产品页面数较少时,便会退出产品。
$$
\text{Disappointment} = \frac{\text{Sessions}}{\text{Total Pages}}. \quad (2)
$$
换句话说,失望度指标反映了用户停止浏览产品页面的速度。失望度的取值范围为(0, 1]。由于失望度指标具有负面含义,因此被另一个表述更为积极的指标——兴趣度所替代。兴趣度指标定义为失望度的补数。
$$
\text{Interest} = 1 - \text{Disappointment}. \quad (3)
$$
失望度和兴趣度指标均在Valsamidis等人(2010b)中提出。
同质性指标是另一个指标,定义为访问产品页面的唯一页面数与访问该产品的会话数量之比(Valsamidis等,2012b)。
$$
\text{Homogeneity} = \frac{\text{Unique pages}}{\text{Total Sessions}}. \quad (4)
$$
其中每个产品的总会话数 ≥ 唯一产品页面数。
同质性指标值的范围为[0, 1],其中0表示没有用户遵循唯一路径,1表示每个用户都遵循了唯一路径。它是一个产品质量指数,用于表征参与产品的每个用户所发现的产品信息的百分比。上述指标有助于评估产品使用情况。
上述指标一旦统计完成,便可用于对产品进行排名。
3.4 层次分类
层次聚类(HAC)是一种将输入数据映射到定义的包含性输出类别的多种数据分析方法。分类首先在低层次上对高度具体的输入数据片段进行。然后,这些数据片段的分类被系统地逐步合并,并在更高层级上迭代分类,直到生成一个输出。
该最终输出即为数据的整体分类。根据具体应用细节,此输出可以是一组预定义输出中的某一个、一组在线学习输出中的某一个,甚至是之前未见过的新颖分类。通常,此类系统依赖于层级中相对简单的个体单元,这些单元仅具有一个通用功能来进行分类(帕帕迪米特里乌,2007)。
本研究的数据为定量变量。为了将定量变量转换为定性变量,我们将其划分为三个数值类别。出于变量间的等价性考虑,我们对每个变量均使用三个类别,这些类别由四分位数确定。每个变量的第一类别包含小于第一四分位数的值(占所有数据的25%),第二类别包含介于第一四分位数和第三四分位数之间的值(占所有数据的50%),第三类别包含大于第三四分位数的值(占所有数据的25%)。因此,每个被统计的变量均以三个值1、2、3(分别表示小值、中等值、大值)进行测量,各变量在测量上无差异。每个变量在数据表中具有相同的权重。第一类别代表小值(小于第一四分位数),第二类别代表中等值(介于第一四分位数和第三四分位数之间),第三类别代表大值(大于第三四分位数)。四个主要变量(会话、页面数、唯一页面、UPPS)被用作分析中的主动变量。初始数据矩阵包含40行(产品)和4列(初始定量变量)。新数据表包含40行和12列(4个变量× 3类别)。
3.5 主成分分析
我们提出的算法称为主成分分析(PCA),它首先尝试根据产品信息资料的匮乏或丰富程度对电子商务系统产品进行分类。随后,基于拥有充足信息资料的电子商务系统产品,该算法试图识别管理员(或根据同质性分类的用户)添加或更新产品信息的频率,以及用户关注这些更新信息的频率(即用户发现更新信息的情况)。最后,通过使用UPPS指标,该算法试图判断产品信息的更新是否能够提升客户对该特定产品的兴趣度。PCA算法的发现模式如图2所示。
根据上述内容,所提出的算法基于丰富度、同质性和UPPS,并由相应的阶段组成。
在算法的第一阶段,使用丰富度指标来识别教育内容贫乏或丰富的产品(贫乏对应较低的丰富度值,丰富对应较高的丰富度值)。我们根据丰富度将一组N个产品按顺序放入一个N阶表格中,其中N ≤ 电子商务系统产品总数,这些产品具有最高的丰富度指标值。
在第二阶段,该算法利用丰富度和同质性值对先前的N个产品进行分类。电子商务系统中产品的分类使用了四个簇,如图2所示。同质性值越高,表示产品更新越频繁或产品内容越动态,具体取决于丰富度值;同质性值越低,则表明电子商务系统更多为静态内容或内容更新较少。产品的分类依赖于N的平均富集值
电子商务系统产品以及高富集簇和低富集簇的平均同质性值。
算法第三阶段的目的是确定内容是否属于丰富或贫乏,以及是静态、频繁还是动态。为此,我们根据UPPS值对每个聚类的产品进行排序。
4 结果
4.1 研究总体与背景
在应用所述方法的前两个阶段后,数据的组织方式如附录1所示。共有40种产品的数据,但由于空间限制,结果仅显示了这40种产品。该数据集来自网址为 http://www.tapanda.gr/ 的电子商店。
4.2 数据预处理和指标与比率的计算
数据采用ASCII格式,来源于Apache服务器日志文件。如方法论第二阶段所述,生成的日志文件经过过滤和预处理,以包含以下字段:产品ID、会话ID和页面统一资源定位符(URL)。在第三步中,计算指数,并得出指标和比率。
4.3 层次聚类结果
我们应用HAC来检测每个产品组的特征。我们使用层次聚类分析对数据表进行分析,由于变量是分类的,因此采用卡方度量(帕帕迪米特里乌,2007)。我们使用Chic分析(马科斯等人,2010)软件、沃德准则,并将结果视为图3树状图中所示的结果。
如图3所示,我们发现了三组产品。首先,我们注意到第73组,其特征是会话、页面数和UPPS的大值。我们可以将此聚类描述为“高频率页面”。
接下来,我们发现第76组产品具有中等和大值的唯一页面。我们可以将此聚类特征描述为“丰富页面”。
此外,我们发现第77组产品在会话、页面数和UPPS方面具有低值。该组被分为三个子组。第66组的特征是唯一页面的值较低。第72组的特征是页面数的值较低且唯一页面的值为中等值。第70组的特征是页面数的值为中等值且唯一页面的值为大值。
4.4 主成分分析的应用
所提出的算法在数据挖掘工具中的有用性应进行评估。为了评估所提出的算法,我们基于来自实际电子商务环境中电子商店使用的数据集。这些数据以ASCII格式存储,源自Apache服务器日志文件。
预处理阶段结束后,应用了PCA算法。我们首先根据丰富度指标对40种产品进行排序。为了测试我们的算法,我们从40种产品的列表中选取了最佳和最差的电子商务系统产品,如表2所示。即从产品使用率的角度来看的最佳和最差情况。
| 产品ID | 会话 | 页面数 | 唯一页面 | UPCS | 同质性 | 丰富度 |
|---|---|---|---|---|---|---|
| PID132 | 152 | 230 | 5 | 184 | 0.033 | 0.978 |
| PID35 | 87 | 338 | 9 | 179 | 0.103 | 0.973 |
| PID125 | 93 | 164 | 6 | 134 | 0.065 | 0.963 |
| PID129 | 75 | 209 | 8 | 131 | 0.107 | 0.962 |
| PID105 | 91 | 297 | 12 | 216 | 0.132 | 0.960 |
| PID41 | 98 | 185 | 8 | 129 | 0.082 | 0.957 |
| PID36 | 72 | 217 | 10 | 134 | 0.139 | 0.954 |
| PID17 | 53 | 206 | 21 | 89 | 0.396 | 0.899 |
| PID66 | 56 | 144 | 16 | 107 | 0.286 | 0.889 |
| PID8 | 45 | 135 | 18 | 82 | 0.400 | 0.867 |
| PID122 | 33 | 71 | 21 | 45 | 0.636 | 0.704 |
| PID112 | 30 | 62 | 20 | 46 | 0.667 | 0.677 |
基于先前对12种电子商务系统产品按丰富度的排序(表2),我们应用主成分分析,其中平均富集值为0.89,高富集簇的平均同质性值为0.09,低富集簇的同质性值为 0.45。主成分分析分类产生了四个簇,如表3所示。
| 丰富度 | 类别 | 同质性 | 聚类 | 产品ID | 会话 | 页面 | 唯一页面数 | UPPS | 同质性 | 增强 |
|---|---|---|---|---|---|---|---|---|---|---|
| High | 动态内容或频繁更新, 聚类I | PID105 | 91 | 297 | 12 | 216 | 0.132 | 0.960 | ||
| PID35 | 87 | 338 | 9 | 179 | 0.103 | 0.973 | ||||
| PID36 | 72 | 217 | 10 | 134 | 0.139 | 0.954 | ||||
| PID129 | 75 | 209 | 8 | 131 | 0.107 | 0.962 | ||||
| 静态内容频繁的更新,集群II | PID132 | 152 | 230 | 5 | 184 | 0.033 | 0.978 | |||
| PID125 | 93 | 164 | 6 | 134 | 0.065 | 0.963 | ||||
| PID41 | 98 | 185 | 8 | 129 | 0.082 | 0.957 | ||||
| Low | 动态内容较少的更新,集群 III | PID112 | 30 | 62 | 20 | 46 | 0.667 | 0.677 | ||
| PID122 | 33 | 71 | 21 | 45 | 0.636 | 0.704 | ||||
| 静态内容 , 集群 IV | PID66 | 56 | 144 | 16 | 107 | 0.286 | 0.889 | |||
| PID17 | 53 | 206 | 21 | 89 | 0.396 | 0.898 | ||||
| PID8 | 45 | 135 | 18 | 82 | 0.400 | 0.867 |
如表3所示,针对四个类别中的每一类,电子商务系统产品均根据UPPS指标值进行排序。
因此,产品PID105和PID36分别为聚类I中高和低UPPS值的代表,PID132和PID41为集群II的代表,PID112和PID122为集群 III 的代表,PID66和PID8为集群 IV 的代表。
在表4中,我们列出了这些产品以及每种产品的主成分分析评估反馈。
| 聚类ID | 产品ID | CCA评估 |
|---|---|---|
| I | PID105 | 高活跃度电子商务系统,其更新被用户关注 |
| I | PID36 | 高活跃度电子商务系统,具有频繁的教育者更新但未被用户关注 |
| II | PID132 | 高活跃度电子商务系统包含静态内容,频繁更新并被用户关注 |
| II | PID41 | 高活跃度电子商务系统包含静态内容,频繁更新但用户关注度低 |
| III | PID112 | 垃圾产品或含更新的论坛——需要进一步评估 |
| III | PID122 | 被遗弃的动态内容产品,任由公开浏览 |
| IV | PID66 | 内容质量差但依然包含信息的产品 被用户关注(或被迫关注) |
| IV | PID8 | 静态内容质量差的产品偶尔会被弃用 好奇的用户 |
5 讨论
许多位于有用路径内的页面有助于提高使用率,这一点相当明显。也就是说,网站上的内容越多、质量越高,用户访问的可能性就越大。因此,管理员应向网站添加一些有用且有益的页面。然而,情况并非如此简单。如果一个网站基本上是空白的,但客户每天都必须访问并发表评论,那么其使用率必然很高。相反,如果一个网站内容丰富、设计精美,但并非必读,那么预期其使用率将有限。因此,这些问题需要得到充分解决。此处仅简要提及这些问题,但在未来的工作中必须予以考虑。
两种算法的应用证明了电子商务系统使用率与相应的产品购买之间存在关系。UPPS得分的提高有助于提升产品销售,从而改善商业成果。
仅对一个电子商务系统中的40种产品进行了研究,这是本研究的一个局限性。特别是对于需要大型数据集的数据分析技术而言。然而,这种情况不可避免,因为该案例研究的电子商务系统只有这么多在线活跃产品。未来,我们计划在其他电子商务系统中应用相同的方法。
我们还计划进一步自动化整个流程,即开发一个插件工具来自动完成数据预处理和指标计算步骤。该工具将定期(每周)运行,并将结果通知给管理员。我们希望最终的工具能够在两个层面提供洞察:
- 在线,包含每个产品的总访问次数(页面和会话)、客户趋势及访问时的活动等统计信息,以及每位客户的详细信息(客户在每个产品上的停留时间和活动、所有产品的客户偏好和活动)
- 离线使用数据挖掘技术,如预处理、可视化、聚类、分类、回归和关联,发现隐藏的数据模式。
6 结论
所提出的迭代方法以新颖的方式利用现有工具和技术进行电子商务系统使用分析。该方法采用指标丰富度、同质性、失望度和兴趣度,并结合了聚类和分类算法。
它具有以下优点。
- 它不依赖于特定的电子商务系统,因为它基于Apache日志文件而非电子商务系统本身。因此,它可以轻松地应用于任何电子商务系统。
- 它使用指数与度量来促进对每个产品的评估。
- 它为公司提供了有用的信息,以确定其网站的哪些部分需要改进。
值得一提的是,这种方法可以在长时间的数据跟踪之后应用。例如,丰富度指标衡量的是一次会话中的访问页面数除以产品的可用页面数。确实,产品中的页面数越多,用户在一次会话中能够查看的比例就越低。另一方面,管理员可能会用更多信息更新产品资料,因此该比率并不会完全降低。
最后需要指出的是,所提出的方法也可应用于其他Web应用,如电子政务、电子学习、电子银行、博客、社交网络等。例如,在电子政务应用中,丰富度显示了向最终用户传递了多少信息,同质性描述了每个用户独立发现的信息所占的百分比。兴趣度表明用户是否对网站上的内容及其有用性感到满意。此外,UPPS为网站使用情况提供了客观的视角。

539

被折叠的 条评论
为什么被折叠?



