/* When transmitting messages in rds_send_xmit, we need to emerge from *timetotimeandbrieflyreleasetheCPU.Otherwisethesoftlockwatchdog *willkickourshin. *Also,itseemsfairertonotletonebusyconnectionstallallthe *others. * *send_batch_countisthenumberoftimeswe'llloopinsend_xmit.Setting *itto0willrestoretheoldbehavior(whereweloopeduntilwehad *drainedthequeue).
*/ staticint send_batch_count = SZ_1K;
module_param(send_batch_count, int, 0444);
MODULE_PARM_DESC(send_batch_count, " batch factor when working the send queue");
staticvoid rds_send_remove_from_sock(struct list_head *messages, int status);
if (cp->cp_xmit_rm) {
rm = cp->cp_xmit_rm;
cp->cp_xmit_rm = NULL; /* Tell the user the RDMA op is no longer mapped by the *transport.Thisisn'tentirelytrue(it'sflushedout *independently)butastheconnectionisdown,there's
* no ongoing RDMA to/from that memory */
rds_message_unmapped(rm);
rds_message_put(rm);
}
/* we want to process as big a batch as we can, but *wealsowanttoavoidsoftlockups.Ifwe'vebeen *throughalotofmessages,letsbackoffandsee *ifanyoneelsejumpsin
*/ if (batch_count >= send_batch_count) goto over_batch;
spin_lock_irqsave(&cp->cp_lock, flags);
if (!list_empty(&cp->cp_send_queue)) {
rm = list_entry(cp->cp_send_queue.next, struct rds_message,
m_conn_item);
rds_message_addref(rm);
/* Unfortunately, the way Infiniband deals with *RDMAtoabadMRkeyisbymovingtheentire *queuepairtoerrorstate.Wecouldpossibly *recoverfromthat,butrightnowwedropthe *connection. *Therefore,weneverretransmitmessageswithRDMAops.
*/ if (test_bit(RDS_MSG_FLUSH, &rm->m_flags) ||
(rm->rdma.op_active &&
test_bit(RDS_MSG_RETRANSMITTED, &rm->m_flags))) {
spin_lock_irqsave(&cp->cp_lock, flags); if (test_and_clear_bit(RDS_MSG_ON_CONN, &rm->m_flags))
list_move(&rm->m_conn_item, &to_be_dropped);
spin_unlock_irqrestore(&cp->cp_lock, flags); continue;
}
/* Require an ACK every once in a while */
len = ntohl(rm->m_inc.i_hdr.h_len); if (cp->cp_unacked_packets == 0 ||
cp->cp_unacked_bytes < len) {
set_bit(RDS_MSG_ACK_REQUIRED, &rm->m_flags);
/* The transport either sends the whole rdma or none of it */ if (rm->rdma.op_active && !cp->cp_xmit_rdma_sent) {
rm->m_final_op = &rm->rdma; /* The transport owns the mapped memory for now. *Youcan'tunmapitwhileit'sonthesendqueue
*/
set_bit(RDS_MSG_MAPPED, &rm->m_flags);
ret = conn->c_trans->xmit_rdma(conn, &rm->rdma); if (ret) {
clear_bit(RDS_MSG_MAPPED, &rm->m_flags);
wake_up_interruptible(&rm->m_flush_wait); break;
}
cp->cp_xmit_rdma_sent = 1;
}
if (rm->atomic.op_active && !cp->cp_xmit_atomic_sent) {
rm->m_final_op = &rm->atomic; /* The transport owns the mapped memory for now. *Youcan'tunmapitwhileit'sonthesendqueue
*/
set_bit(RDS_MSG_MAPPED, &rm->m_flags);
ret = conn->c_trans->xmit_atomic(conn, &rm->atomic); if (ret) {
clear_bit(RDS_MSG_MAPPED, &rm->m_flags);
wake_up_interruptible(&rm->m_flush_wait); break;
}
cp->cp_xmit_atomic_sent = 1;
}
/* *AnumberofcasesrequireanRDSheadertobesent *evenifthereisnodata. *Wepermit0-bytesends;rds-pingdependsonthis. *However,ifthereareexclusivelyattachedsilentops, *weskipthehdr/datasend,toenablesilentoperation.
*/ if (rm->data.op_nents == 0) { int ops_present; int all_ops_are_silent = 1;
ops_present = (rm->atomic.op_active || rm->rdma.op_active); if (rm->atomic.op_active && !rm->atomic.op_silent)
all_ops_are_silent = 0; if (rm->rdma.op_active && !rm->rdma.op_silent)
all_ops_are_silent = 0;
if (ops_present && all_ops_are_silent
&& !rm->m_rdma_cookie)
rm->data.op_active = 0;
}
if (rm->data.op_active && !cp->cp_xmit_data_sent) {
rm->m_final_op = &rm->data;
ret = conn->c_trans->xmit(conn, rm,
cp->cp_xmit_hdr_off,
cp->cp_xmit_sg,
cp->cp_xmit_data_off); if (ret <= 0) break;
over_batch: if (conn->c_trans->xmit_path_complete)
conn->c_trans->xmit_path_complete(cp);
release_in_xmit(cp);
/* Nuke any messages we decided not to retransmit. */ if (!list_empty(&to_be_dropped)) { /* irqs on here, so we can put(), unlike above */
list_for_each_entry(rm, &to_be_dropped, m_conn_item)
rds_message_put(rm);
rds_send_remove_from_sock(&to_be_dropped, RDS_RDMA_DROPPED);
}
/* order flag updates with spin locks */ if (!list_empty(&list))
smp_mb__after_atomic();
spin_unlock_irqrestore(&cp->cp_lock, flags);
/* now remove the messages from the sock list as needed */
rds_send_remove_from_sock(&list, RDS_RDMA_SUCCESS);
}
EXPORT_SYMBOL_GPL(rds_send_path_drop_acked);
/* just in case the code above skipped this message *becauseRDS_MSG_ON_CONNwasn'tset,runitagainhere *takingm_rs_lockistheonlythingthatkeepsus *fromracingwithackprocessing.
*/
spin_lock_irqsave(&rm->m_rs_lock, flags);
/* let recv side know we are close to send space exhaustion. *Thisisprobablynottheoptimalwaytodoit,asthis *meanswesettheflagon*all*messagesassoonasour *throughputhitsacertainthreshold.
*/ if (rs->rs_snd_bytes >= rds_sk_sndbuf(rs) / 2)
set_bit(RDS_MSG_ACK_REQUIRED, &rm->m_flags);
/* The code ordering is a little weird, but we're
trying to minimize the time we hold c_lock */
rds_message_populate_header(&rm->m_inc.i_hdr, sport, dport, 0);
rm->m_inc.i_conn = conn;
rm->m_inc.i_conn_path = cp;
rds_message_addref(rm);
case RDS_CMSG_ZCOPY_COOKIE:
zcopy_cookie = true;
fallthrough;
case RDS_CMSG_RDMA_DEST: case RDS_CMSG_RDMA_MAP:
cmsg_groups |= 2; /* these are valid but do no add any size */ break;
case RDS_CMSG_ATOMIC_CSWP: case RDS_CMSG_ATOMIC_FADD: case RDS_CMSG_MASKED_ATOMIC_CSWP: case RDS_CMSG_MASKED_ATOMIC_FADD:
cmsg_groups |= 1;
size += sizeof(struct scatterlist); break;
default: return -EINVAL;
}
}
if ((msg->msg_flags & MSG_ZEROCOPY) && !zcopy_cookie) return -EINVAL;
size += num_sgs * sizeof(struct scatterlist);
/* Ensure (DEST, MAP) are never used with (ARGS, ATOMIC) */ if (cmsg_groups == 3) return -EINVAL;
staticint rds_cmsg_send(struct rds_sock *rs, struct rds_message *rm, struct msghdr *msg, int *allocated_mr, struct rds_iov_vector_arr *vct)
{ struct cmsghdr *cmsg; int ret = 0, ind = 0;
for_each_cmsghdr(cmsg, msg) { if (!CMSG_OK(msg, cmsg)) return -EINVAL;
if (cmsg->cmsg_level != SOL_RDS) continue;
/* As a side effect, RDMA_DEST and RDMA_MAP will set *rm->rdma.m_rdma_cookieandrm->rdma.m_rdma_mr.
*/ switch (cmsg->cmsg_type) { case RDS_CMSG_RDMA_ARGS: if (ind >= vct->indx) return -ENOMEM;
ret = rds_cmsg_rdma_args(rs, rm, cmsg, &vct->vec[ind]);
ind++; break;
case RDS_CMSG_RDMA_DEST:
ret = rds_cmsg_rdma_dest(rs, rm, cmsg); break;
case RDS_CMSG_RDMA_MAP:
ret = rds_cmsg_rdma_map(rs, rm, cmsg); if (!ret)
*allocated_mr = 1; elseif (ret == -ENODEV) /* Accommodate the get_mr() case which can fail *ifconnectionisn'testablishedyet.
*/
ret = -EAGAIN; break; case RDS_CMSG_ATOMIC_CSWP: case RDS_CMSG_ATOMIC_FADD: case RDS_CMSG_MASKED_ATOMIC_CSWP: case RDS_CMSG_MASKED_ATOMIC_FADD:
ret = rds_cmsg_atomic(rs, rm, cmsg); break;
case RDS_CMSG_ZCOPY_COOKIE:
ret = rds_cmsg_zcopy(rs, rm, cmsg); break;
default: return -EINVAL;
}
if (ret) break;
}
return ret;
}
staticint rds_send_mprds_hash(struct rds_sock *rs, struct rds_connection *conn, int nonblock)
{ int hash;
/* The underlying connection is not up yet. Need to wait *untilitisuptobesurethatthenon-zeroc_pathcanbe *used.Butifweareinterrupted,wehavetousethezero *c_pathincasetheconnectionendsupbeingnon-MPcapable.
*/ if (conn->c_npaths == 0) { /* Cannot wait for the connection be made, so just use *thebasec_path.
*/ if (nonblock) return0; if (wait_event_interruptible(conn->c_hs_waitq,
conn->c_npaths != 0))
hash = 0;
} if (conn->c_npaths == 1)
hash = 0;
} return hash;
}
/* expect 1 RDMA CMSG per rds_sendmsg. can still grow if more needed. */
vct.incr = 1;
/* Mirror Linux UDP mirror of BSD error message compatibility */ /* XXX: Perhaps MSG_MORE someday */ if (msg->msg_flags & ~(MSG_DONTWAIT | MSG_CMSG_COMPAT | MSG_ZEROCOPY)) {
ret = -EOPNOTSUPP; goto out;
}
namelen = msg->msg_namelen; if (namelen != 0) { if (namelen < sizeof(*usin)) {
ret = -EINVAL; goto out;
} switch (usin->sin_family) { case AF_INET: if (usin->sin_addr.s_addr == htonl(INADDR_ANY) ||
usin->sin_addr.s_addr == htonl(INADDR_BROADCAST) ||
ipv4_is_multicast(usin->sin_addr.s_addr)) {
ret = -EINVAL; goto out;
}
ipv6_addr_set_v4mapped(usin->sin_addr.s_addr, &daddr);
dport = usin->sin_port; break;
#if IS_ENABLED(CONFIG_IPV6) case AF_INET6: { int addr_type;
if (namelen < sizeof(*sin6)) {
ret = -EINVAL; goto out;
}
addr_type = ipv6_addr_type(&sin6->sin6_addr); if (!(addr_type & IPV6_ADDR_UNICAST)) {
__be32 addr4;
if (!(addr_type & IPV6_ADDR_MAPPED)) {
ret = -EINVAL; goto out;
}
/* It is a mapped address. Need to do some *sanitychecks.
*/
addr4 = sin6->sin6_addr.s6_addr32[3]; if (addr4 == htonl(INADDR_ANY) ||
addr4 == htonl(INADDR_BROADCAST) ||
ipv4_is_multicast(addr4)) {
ret = -EINVAL; goto out;
}
} if (addr_type & IPV6_ADDR_LINKLOCAL) { if (sin6->sin6_scope_id == 0) {
ret = -EINVAL; goto out;
}
scope_id = sin6->sin6_scope_id;
}
default:
ret = -EINVAL; goto out;
}
} else { /* We only care about consistency with ->connect() */
lock_sock(sk);
daddr = rs->rs_conn_addr;
dport = rs->rs_conn_port;
scope_id = rs->rs_bound_scope_id;
release_sock(sk);
}
lock_sock(sk); if (ipv6_addr_any(&rs->rs_bound_addr) || ipv6_addr_any(&daddr)) {
release_sock(sk);
ret = -ENOTCONN; goto out;
} elseif (namelen != 0) { /* Cannot send to an IPv4 address using an IPv6 source *addressandcannotsendtoanIPv6addressusingan *IPv4sourceaddress.
*/ if (ipv6_addr_v4mapped(&daddr) ^
ipv6_addr_v4mapped(&rs->rs_bound_addr)) {
release_sock(sk);
ret = -EOPNOTSUPP; goto out;
} /* If the socket is already bound to a link local address, *itcanonlysendtopeersonthesamelink.Butallow *communicatingbetweenlinklocalandnon-linklocaladdress.
*/ if (scope_id != rs->rs_bound_scope_id) { if (!scope_id) {
scope_id = rs->rs_bound_scope_id;
} elseif (rs->rs_bound_scope_id) {
release_sock(sk);
ret = -EINVAL; goto out;
}
}
}
release_sock(sk);
ret = rds_rdma_bytes(msg, &rdma_payload_len); if (ret) goto out;
if (max_t(size_t, payload_len, rdma_payload_len) > RDS_MAX_MSG_SIZE) {
ret = -EMSGSIZE; goto out;
}
if (payload_len > rds_sk_sndbuf(rs)) {
ret = -EMSGSIZE; goto out;
}
if (zcopy) { if (rs->rs_transport->t_type != RDS_TRANS_TCP) {
ret = -EOPNOTSUPP; goto out;
}
num_sgs = iov_iter_npages(&msg->msg_iter, INT_MAX);
} /* size of rm including all sgs */
ret = rds_rm_size(msg, num_sgs, &vct); if (ret < 0) goto out;
rm = rds_message_alloc(ret, GFP_KERNEL); if (!rm) {
ret = -ENOMEM; goto out;
}
/* Attach data to the rm */ if (payload_len) {
rm->data.op_sg = rds_message_alloc_sgs(rm, num_sgs); if (IS_ERR(rm->data.op_sg)) {
ret = PTR_ERR(rm->data.op_sg); goto out;
}
ret = rds_message_copy_from_user(rm, &msg->msg_iter, zcopy); if (ret) goto out;
}
rm->data.op_active = 1;
rm->m_daddr = daddr;
/* rds_conn_create has a spinlock that runs with IRQ off.
* Caching the conn in the socket helps a lot. */ if (rs->rs_conn && ipv6_addr_equal(&rs->rs_conn->c_faddr, &daddr) &&
rs->rs_tos == rs->rs_conn->c_tos) {
conn = rs->rs_conn;
} else {
conn = rds_conn_create_outgoing(sock_net(sock->sk),
&rs->rs_bound_addr, &daddr,
rs->rs_transport, rs->rs_tos,
sock->sk->sk_allocation,
scope_id); if (IS_ERR(conn)) {
ret = PTR_ERR(conn); goto out;
}
rs->rs_conn = conn;
}
ret = rds_send_xmit(cpath); if (ret == -ENOMEM || ret == -EAGAIN) {
ret = 0;
rcu_read_lock(); if (rds_destroy_pending(cpath->cp_conn))
ret = -ENETUNREACH; else
queue_delayed_work(rds_wq, &cpath->cp_send_w, 1);
rcu_read_unlock();
} if (ret) goto out;
rds_message_put(rm);
for (ind = 0; ind < vct.indx; ind++)
kfree(vct.vec[ind].iov);
kfree(vct.vec);
return payload_len;
out: for (ind = 0; ind < vct.indx; ind++)
kfree(vct.vec[ind].iov);
kfree(vct.vec);
/* If the user included a RDMA_MAP cmsg, we allocated a MR on the fly. *Ifthesendmsggoesthrough,wekeeptheMR.IfitfailswithEAGAIN
* or in any other way, we need to destroy the MR again */ if (allocated_mr)
rds_rdma_unuse(rs, rds_rdma_cookie_key(rm->m_rdma_cookie), 1);
/* schedule the send work on rds_wq */
rcu_read_lock(); if (!rds_destroy_pending(cp->cp_conn))
queue_delayed_work(rds_wq, &cp->cp_send_w, 1);
rcu_read_unlock();
Die Informationen auf dieser Webseite wurden
nach bestem Wissen sorgfältig zusammengestellt. Es wird jedoch weder Vollständigkeit, noch Richtigkeit,
noch Qualität der bereit gestellten Informationen zugesichert.
Bemerkung:
Die farbliche Syntaxdarstellung und die Messung sind noch experimentell.